GenesisGeo-250915a / trainer_state.json
twilightsnow's picture
update files
6c978f3 verified
Raw History Blame Contribute Delete
31.8 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 2.816636935499014,
"eval_steps": 10000.0,
"global_step": 120000,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 2.3471974462491784e-05,
"grad_norm": 6.873311519622803,
"learning_rate": 4.694394892498357e-09,
"loss": 0.9773223996162415,
"memory(GiB)": 6.34,
"step": 1,
"train_speed(iter/s)": 0.134689
},
{
"epoch": 0.023471974462491784,
"grad_norm": 0.7090998291969299,
"learning_rate": 4.694394892498357e-06,
"loss": 0.2067977095748092,
"memory(GiB)": 6.98,
"step": 1000,
"train_speed(iter/s)": 0.770601
},
{
"epoch": 0.04694394892498357,
"grad_norm": 0.5364481806755066,
"learning_rate": 9.388789784996714e-06,
"loss": 0.044086185455322266,
"memory(GiB)": 6.98,
"step": 2000,
"train_speed(iter/s)": 0.772463
},
{
"epoch": 0.07041592338747535,
"grad_norm": 0.35766565799713135,
"learning_rate": 1.408318467749507e-05,
"loss": 0.031457195281982424,
"memory(GiB)": 6.98,
"step": 3000,
"train_speed(iter/s)": 0.773056
},
{
"epoch": 0.09388789784996714,
"grad_norm": 0.20579440891742706,
"learning_rate": 1.8777579569993428e-05,
"loss": 0.025429149627685547,
"memory(GiB)": 6.98,
"step": 4000,
"train_speed(iter/s)": 0.773119
},
{
"epoch": 0.11735987231245892,
"grad_norm": 0.22555053234100342,
"learning_rate": 2.3471974462491787e-05,
"loss": 0.021895978927612306,
"memory(GiB)": 6.98,
"step": 5000,
"train_speed(iter/s)": 0.773348
},
{
"epoch": 0.1408318467749507,
"grad_norm": 0.15718838572502136,
"learning_rate": 2.816636935499014e-05,
"loss": 0.01944416618347168,
"memory(GiB)": 6.98,
"step": 6000,
"train_speed(iter/s)": 0.773516
},
{
"epoch": 0.1643038212374425,
"grad_norm": 0.129106342792511,
"learning_rate": 3.28607642474885e-05,
"loss": 0.017256214141845704,
"memory(GiB)": 6.98,
"step": 7000,
"train_speed(iter/s)": 0.773625
},
{
"epoch": 0.18777579569993427,
"grad_norm": 0.12290780991315842,
"learning_rate": 3.7555159139986855e-05,
"loss": 0.015874351501464844,
"memory(GiB)": 6.98,
"step": 8000,
"train_speed(iter/s)": 0.773509
},
{
"epoch": 0.21124777016242607,
"grad_norm": 0.08948824554681778,
"learning_rate": 4.2249554032485215e-05,
"loss": 0.016113059997558594,
"memory(GiB)": 6.98,
"step": 9000,
"train_speed(iter/s)": 0.773568
},
{
"epoch": 0.23471974462491785,
"grad_norm": 0.0859590545296669,
"learning_rate": 4.6943948924983574e-05,
"loss": 0.013513467788696288,
"memory(GiB)": 6.98,
"step": 10000,
"train_speed(iter/s)": 0.773615
},
{
"epoch": 0.2581917190874096,
"grad_norm": 0.06912733614444733,
"learning_rate": 5.163834381748193e-05,
"loss": 0.012883235931396484,
"memory(GiB)": 6.98,
"step": 11000,
"train_speed(iter/s)": 0.773538
},
{
"epoch": 0.2816636935499014,
"grad_norm": 0.0689440667629242,
"learning_rate": 5.633273870998028e-05,
"loss": 0.012275049209594727,
"memory(GiB)": 6.98,
"step": 12000,
"train_speed(iter/s)": 0.773456
},
{
"epoch": 0.3051356680123932,
"grad_norm": 0.05962664261460304,
"learning_rate": 6.1027133602478646e-05,
"loss": 0.011764054298400878,
"memory(GiB)": 6.98,
"step": 13000,
"train_speed(iter/s)": 0.773525
},
{
"epoch": 0.328607642474885,
"grad_norm": 0.06685680896043777,
"learning_rate": 6.5721528494977e-05,
"loss": 0.011147622108459473,
"memory(GiB)": 6.98,
"step": 14000,
"train_speed(iter/s)": 0.773587
},
{
"epoch": 0.35207961693737677,
"grad_norm": 0.055886879563331604,
"learning_rate": 7.041592338747535e-05,
"loss": 0.010751012802124024,
"memory(GiB)": 6.98,
"step": 15000,
"train_speed(iter/s)": 0.773522
},
{
"epoch": 0.37555159139986855,
"grad_norm": 0.05007677897810936,
"learning_rate": 7.511031827997371e-05,
"loss": 0.010270029067993165,
"memory(GiB)": 6.98,
"step": 16000,
"train_speed(iter/s)": 0.773572
},
{
"epoch": 0.3990235658623603,
"grad_norm": 0.04750866815447807,
"learning_rate": 7.980471317247207e-05,
"loss": 0.014723161697387695,
"memory(GiB)": 6.98,
"step": 17000,
"train_speed(iter/s)": 0.77362
},
{
"epoch": 0.42249554032485215,
"grad_norm": 0.0429859384894371,
"learning_rate": 8.449910806497043e-05,
"loss": 0.00955332088470459,
"memory(GiB)": 6.98,
"step": 18000,
"train_speed(iter/s)": 0.773663
},
{
"epoch": 0.4459675147873439,
"grad_norm": 0.04136689752340317,
"learning_rate": 8.919350295746879e-05,
"loss": 0.008662021636962891,
"memory(GiB)": 6.98,
"step": 19000,
"train_speed(iter/s)": 0.773622
},
{
"epoch": 0.4694394892498357,
"grad_norm": 0.037089236080646515,
"learning_rate": 9.388789784996715e-05,
"loss": 0.00884601593017578,
"memory(GiB)": 6.98,
"step": 20000,
"train_speed(iter/s)": 0.773654
},
{
"epoch": 0.49291146371232747,
"grad_norm": 0.04602020978927612,
"learning_rate": 9.85822927424655e-05,
"loss": 0.008930742263793945,
"memory(GiB)": 6.98,
"step": 21000,
"train_speed(iter/s)": 0.773619
},
{
"epoch": 0.5163834381748192,
"grad_norm": 0.03754112869501114,
"learning_rate": 9.9997056509798e-05,
"loss": 0.008811912536621093,
"memory(GiB)": 6.98,
"step": 22000,
"train_speed(iter/s)": 0.773654
},
{
"epoch": 0.5398554126373111,
"grad_norm": 0.038691937923431396,
"learning_rate": 9.998258177739357e-05,
"loss": 0.008538522720336915,
"memory(GiB)": 6.98,
"step": 23000,
"train_speed(iter/s)": 0.773604
},
{
"epoch": 0.5633273870998028,
"grad_norm": 0.035799555480480194,
"learning_rate": 9.995602866673978e-05,
"loss": 0.008209162712097168,
"memory(GiB)": 6.98,
"step": 24000,
"train_speed(iter/s)": 0.773623
},
{
"epoch": 0.5867993615622946,
"grad_norm": 0.029186313971877098,
"learning_rate": 9.99174043076745e-05,
"loss": 0.012456470489501954,
"memory(GiB)": 6.98,
"step": 25000,
"train_speed(iter/s)": 0.773622
},
{
"epoch": 0.6102713360247864,
"grad_norm": 0.030947748571634293,
"learning_rate": 9.98667190713147e-05,
"loss": 0.0070707683563232425,
"memory(GiB)": 6.98,
"step": 26000,
"train_speed(iter/s)": 0.773612
},
{
"epoch": 0.6337433104872782,
"grad_norm": 0.2330833226442337,
"learning_rate": 9.980398656727177e-05,
"loss": 0.006968212127685547,
"memory(GiB)": 6.98,
"step": 27000,
"train_speed(iter/s)": 0.773568
},
{
"epoch": 0.65721528494977,
"grad_norm": 0.028112607076764107,
"learning_rate": 9.97292236399971e-05,
"loss": 0.007095534801483155,
"memory(GiB)": 6.98,
"step": 28000,
"train_speed(iter/s)": 0.773592
},
{
"epoch": 0.6806872594122617,
"grad_norm": 0.02619938738644123,
"learning_rate": 9.964245036425917e-05,
"loss": 0.008339838981628418,
"memory(GiB)": 6.98,
"step": 29000,
"train_speed(iter/s)": 0.773625
},
{
"epoch": 0.7041592338747535,
"grad_norm": 0.025133736431598663,
"learning_rate": 9.954369003975321e-05,
"loss": 0.0064864115715026855,
"memory(GiB)": 6.98,
"step": 30000,
"train_speed(iter/s)": 0.773609
},
{
"epoch": 0.7276312083372454,
"grad_norm": 0.027932610362768173,
"learning_rate": 9.943296918484496e-05,
"loss": 0.006537047863006592,
"memory(GiB)": 6.98,
"step": 31000,
"train_speed(iter/s)": 0.773583
},
{
"epoch": 0.7511031827997371,
"grad_norm": 0.025137219578027725,
"learning_rate": 9.931031752945016e-05,
"loss": 0.006564114570617676,
"memory(GiB)": 6.98,
"step": 32000,
"train_speed(iter/s)": 0.773606
},
{
"epoch": 0.7745751572622289,
"grad_norm": 0.025504019111394882,
"learning_rate": 9.917576800705166e-05,
"loss": 0.006496795654296875,
"memory(GiB)": 6.98,
"step": 33000,
"train_speed(iter/s)": 0.773632
},
{
"epoch": 0.7980471317247206,
"grad_norm": 0.02448360249400139,
"learning_rate": 9.902935674585645e-05,
"loss": 0.006350491523742676,
"memory(GiB)": 6.98,
"step": 34000,
"train_speed(iter/s)": 0.773604
},
{
"epoch": 0.8215191061872125,
"grad_norm": 0.025678610429167747,
"learning_rate": 9.887112305909476e-05,
"loss": 0.006270767211914063,
"memory(GiB)": 6.98,
"step": 35000,
"train_speed(iter/s)": 0.773637
},
{
"epoch": 0.8449910806497043,
"grad_norm": 0.020809423178434372,
"learning_rate": 9.870110943446392e-05,
"loss": 0.006130220413208008,
"memory(GiB)": 6.98,
"step": 36000,
"train_speed(iter/s)": 0.773667
},
{
"epoch": 0.868463055112196,
"grad_norm": 0.02085060253739357,
"learning_rate": 9.851936152271996e-05,
"loss": 0.005994909763336181,
"memory(GiB)": 6.98,
"step": 37000,
"train_speed(iter/s)": 0.7737
},
{
"epoch": 0.8919350295746878,
"grad_norm": 0.023238450288772583,
"learning_rate": 9.832592812541974e-05,
"loss": 0.005881279468536377,
"memory(GiB)": 6.98,
"step": 38000,
"train_speed(iter/s)": 0.773678
},
{
"epoch": 0.9154070040371796,
"grad_norm": 0.022812778130173683,
"learning_rate": 9.812086118181725e-05,
"loss": 0.005744485855102539,
"memory(GiB)": 6.98,
"step": 39000,
"train_speed(iter/s)": 0.773711
},
{
"epoch": 0.9388789784996714,
"grad_norm": 0.022495215758681297,
"learning_rate": 9.790421575491719e-05,
"loss": 0.005901573181152343,
"memory(GiB)": 6.98,
"step": 40000,
"train_speed(iter/s)": 0.773731
},
{
"epoch": 0.9623509529621632,
"grad_norm": 0.02446814998984337,
"learning_rate": 9.767605001668988e-05,
"loss": 0.005200364112854004,
"memory(GiB)": 6.98,
"step": 41000,
"train_speed(iter/s)": 0.773715
},
{
"epoch": 0.9858229274246549,
"grad_norm": 0.020658565685153008,
"learning_rate": 9.743642523245135e-05,
"loss": 0.005229688167572021,
"memory(GiB)": 6.98,
"step": 42000,
"train_speed(iter/s)": 0.773696
},
{
"epoch": 1.0092949018871467,
"grad_norm": 0.021865155547857285,
"learning_rate": 9.718540574441292e-05,
"loss": 0.005165683746337891,
"memory(GiB)": 6.98,
"step": 43000,
"train_speed(iter/s)": 0.773678
},
{
"epoch": 1.0327668763496385,
"grad_norm": 0.0181892029941082,
"learning_rate": 9.692305895440446e-05,
"loss": 0.005038617134094238,
"memory(GiB)": 6.98,
"step": 44000,
"train_speed(iter/s)": 0.77369
},
{
"epoch": 1.0562388508121303,
"grad_norm": 0.020988518372178078,
"learning_rate": 9.664945530577624e-05,
"loss": 0.005030522346496582,
"memory(GiB)": 6.98,
"step": 45000,
"train_speed(iter/s)": 0.773703
},
{
"epoch": 1.0797108252746221,
"grad_norm": 0.01870891824364662,
"learning_rate": 9.636466826448388e-05,
"loss": 0.004962910175323487,
"memory(GiB)": 6.98,
"step": 46000,
"train_speed(iter/s)": 0.77367
},
{
"epoch": 1.103182799737114,
"grad_norm": 0.020105397328734398,
"learning_rate": 9.6068774299362e-05,
"loss": 0.004928079128265381,
"memory(GiB)": 6.98,
"step": 47000,
"train_speed(iter/s)": 0.773684
},
{
"epoch": 1.1266547741996056,
"grad_norm": 0.017308305948972702,
"learning_rate": 9.576185286159124e-05,
"loss": 0.004844691276550293,
"memory(GiB)": 6.98,
"step": 48000,
"train_speed(iter/s)": 0.773704
},
{
"epoch": 1.1501267486620974,
"grad_norm": 0.02030794508755207,
"learning_rate": 9.54439863633648e-05,
"loss": 0.004808475494384765,
"memory(GiB)": 6.98,
"step": 49000,
"train_speed(iter/s)": 0.773693
},
{
"epoch": 1.1735987231245892,
"grad_norm": 0.021403463557362556,
"learning_rate": 9.511526015575962e-05,
"loss": 0.0047379093170166016,
"memory(GiB)": 6.98,
"step": 50000,
"train_speed(iter/s)": 0.773715
},
{
"epoch": 1.197070697587081,
"grad_norm": 0.02005721814930439,
"learning_rate": 9.477576250581859e-05,
"loss": 0.004678564548492432,
"memory(GiB)": 6.98,
"step": 51000,
"train_speed(iter/s)": 0.773696
},
{
"epoch": 1.220542672049573,
"grad_norm": 0.019888877868652344,
"learning_rate": 9.442558457284981e-05,
"loss": 0.004646867275238037,
"memory(GiB)": 6.98,
"step": 52000,
"train_speed(iter/s)": 0.773713
},
{
"epoch": 1.2440146465120645,
"grad_norm": 0.01766289584338665,
"learning_rate": 9.406482038394913e-05,
"loss": 0.005699957847595215,
"memory(GiB)": 6.98,
"step": 53000,
"train_speed(iter/s)": 0.773705
},
{
"epoch": 1.2674866209745563,
"grad_norm": 0.01960998773574829,
"learning_rate": 9.369356680875276e-05,
"loss": 0.004132438182830811,
"memory(GiB)": 6.98,
"step": 54000,
"train_speed(iter/s)": 0.773731
},
{
"epoch": 1.2909585954370482,
"grad_norm": 0.01634296402335167,
"learning_rate": 9.331192353342657e-05,
"loss": 0.0040699739456176755,
"memory(GiB)": 6.98,
"step": 55000,
"train_speed(iter/s)": 0.773755
},
{
"epoch": 1.31443056989954,
"grad_norm": 0.019385425373911858,
"learning_rate": 9.291999303389908e-05,
"loss": 0.004208338260650635,
"memory(GiB)": 6.98,
"step": 56000,
"train_speed(iter/s)": 0.773776
},
{
"epoch": 1.3379025443620316,
"grad_norm": 0.01933792047202587,
"learning_rate": 9.251788054834548e-05,
"loss": 0.0042822351455688475,
"memory(GiB)": 6.98,
"step": 57000,
"train_speed(iter/s)": 0.773762
},
{
"epoch": 1.3613745188245234,
"grad_norm": 0.018314572051167488,
"learning_rate": 9.210569404892982e-05,
"loss": 0.004284262657165527,
"memory(GiB)": 6.98,
"step": 58000,
"train_speed(iter/s)": 0.773784
},
{
"epoch": 1.3848464932870153,
"grad_norm": 0.0157700777053833,
"learning_rate": 9.168354421281314e-05,
"loss": 0.004284625053405762,
"memory(GiB)": 6.98,
"step": 59000,
"train_speed(iter/s)": 0.7738
},
{
"epoch": 1.408318467749507,
"grad_norm": 0.01911577582359314,
"learning_rate": 9.125154439243543e-05,
"loss": 0.004283618450164795,
"memory(GiB)": 6.98,
"step": 60000,
"train_speed(iter/s)": 0.773821
},
{
"epoch": 1.431790442211999,
"grad_norm": 0.01760895363986492,
"learning_rate": 9.080981058507891e-05,
"loss": 0.0042250375747680665,
"memory(GiB)": 6.98,
"step": 61000,
"train_speed(iter/s)": 0.773787
},
{
"epoch": 1.4552624166744907,
"grad_norm": 0.016973674297332764,
"learning_rate": 9.035846140172137e-05,
"loss": 0.004184374809265137,
"memory(GiB)": 6.98,
"step": 62000,
"train_speed(iter/s)": 0.773805
},
{
"epoch": 1.4787343911369826,
"grad_norm": 0.018145151436328888,
"learning_rate": 8.989761803518783e-05,
"loss": 0.0041481399536132816,
"memory(GiB)": 6.98,
"step": 63000,
"train_speed(iter/s)": 0.773822
},
{
"epoch": 1.5022063655994742,
"grad_norm": 0.018821215257048607,
"learning_rate": 8.942740422760855e-05,
"loss": 0.004085684776306152,
"memory(GiB)": 6.98,
"step": 64000,
"train_speed(iter/s)": 0.773834
},
{
"epoch": 1.525678340061966,
"grad_norm": 0.016859283670783043,
"learning_rate": 8.894794623719286e-05,
"loss": 0.004074786186218262,
"memory(GiB)": 6.98,
"step": 65000,
"train_speed(iter/s)": 0.773829
},
{
"epoch": 1.5491503145244578,
"grad_norm": 0.018960464745759964,
"learning_rate": 8.84593728043272e-05,
"loss": 0.004000515460968018,
"memory(GiB)": 6.98,
"step": 66000,
"train_speed(iter/s)": 0.773845
},
{
"epoch": 1.5726222889869494,
"grad_norm": 0.01604197360575199,
"learning_rate": 8.796181511700688e-05,
"loss": 0.00393418288230896,
"memory(GiB)": 6.98,
"step": 67000,
"train_speed(iter/s)": 0.773862
},
{
"epoch": 1.5960942634494413,
"grad_norm": 0.018188416957855225,
"learning_rate": 8.745540677561029e-05,
"loss": 0.00391404390335083,
"memory(GiB)": 6.98,
"step": 68000,
"train_speed(iter/s)": 0.773854
},
{
"epoch": 1.619566237911933,
"grad_norm": 0.016790760681033134,
"learning_rate": 8.694028375702572e-05,
"loss": 0.0038784058094024658,
"memory(GiB)": 6.98,
"step": 69000,
"train_speed(iter/s)": 0.773863
},
{
"epoch": 1.643038212374425,
"grad_norm": 0.017686154693365097,
"learning_rate": 8.641658437813977e-05,
"loss": 0.0038486015796661377,
"memory(GiB)": 6.98,
"step": 70000,
"train_speed(iter/s)": 0.773875
},
{
"epoch": 1.6665101868369168,
"grad_norm": 0.016662968322634697,
"learning_rate": 8.588444925869765e-05,
"loss": 0.003811450719833374,
"memory(GiB)": 6.98,
"step": 71000,
"train_speed(iter/s)": 0.773869
},
{
"epoch": 1.6899821612994086,
"grad_norm": 0.01588079333305359,
"learning_rate": 8.53440212835449e-05,
"loss": 0.0037576057910919188,
"memory(GiB)": 6.98,
"step": 72000,
"train_speed(iter/s)": 0.773859
},
{
"epoch": 1.7134541357619004,
"grad_norm": 0.017528703436255455,
"learning_rate": 8.479544556426129e-05,
"loss": 0.0037284982204437256,
"memory(GiB)": 6.98,
"step": 73000,
"train_speed(iter/s)": 0.773877
},
{
"epoch": 1.736926110224392,
"grad_norm": 0.016123304143548012,
"learning_rate": 8.423886940019631e-05,
"loss": 0.003685460567474365,
"memory(GiB)": 6.98,
"step": 74000,
"train_speed(iter/s)": 0.773895
},
{
"epoch": 1.7603980846868839,
"grad_norm": 0.016363080590963364,
"learning_rate": 8.367444223891764e-05,
"loss": 0.003638455867767334,
"memory(GiB)": 6.98,
"step": 75000,
"train_speed(iter/s)": 0.773914
},
{
"epoch": 1.7838700591493757,
"grad_norm": 0.017023220658302307,
"learning_rate": 8.310231563608256e-05,
"loss": 0.003618378162384033,
"memory(GiB)": 6.98,
"step": 76000,
"train_speed(iter/s)": 0.773913
},
{
"epoch": 1.8073420336118673,
"grad_norm": 0.018276922404766083,
"learning_rate": 8.252264321474346e-05,
"loss": 0.0035556938648223877,
"memory(GiB)": 6.98,
"step": 77000,
"train_speed(iter/s)": 0.773935
},
{
"epoch": 1.8308140080743591,
"grad_norm": 0.018186427652835846,
"learning_rate": 8.193558062409806e-05,
"loss": 0.0035327181816101074,
"memory(GiB)": 6.98,
"step": 78000,
"train_speed(iter/s)": 0.77396
},
{
"epoch": 1.854285982536851,
"grad_norm": 0.01577594503760338,
"learning_rate": 8.134128549769571e-05,
"loss": 0.0034980549812316897,
"memory(GiB)": 6.98,
"step": 79000,
"train_speed(iter/s)": 0.773984
},
{
"epoch": 1.8777579569993428,
"grad_norm": 0.016289088875055313,
"learning_rate": 8.073991741111093e-05,
"loss": 0.0034754557609558106,
"memory(GiB)": 6.98,
"step": 80000,
"train_speed(iter/s)": 0.773982
},
{
"epoch": 1.9012299314618346,
"grad_norm": 0.014553467743098736,
"learning_rate": 8.013163783909524e-05,
"loss": 0.0034601585865020753,
"memory(GiB)": 6.98,
"step": 81000,
"train_speed(iter/s)": 0.773986
},
{
"epoch": 1.9247019059243264,
"grad_norm": 0.01678823120892048,
"learning_rate": 7.951661011221935e-05,
"loss": 0.0034030678272247315,
"memory(GiB)": 6.98,
"step": 82000,
"train_speed(iter/s)": 0.774
},
{
"epoch": 1.9481738803868183,
"grad_norm": 0.01649617776274681,
"learning_rate": 7.889499937301675e-05,
"loss": 0.0033872227668762206,
"memory(GiB)": 6.98,
"step": 83000,
"train_speed(iter/s)": 0.774008
},
{
"epoch": 1.9716458548493099,
"grad_norm": 0.015564069151878357,
"learning_rate": 7.8266972531641e-05,
"loss": 0.0033475735187530518,
"memory(GiB)": 6.98,
"step": 84000,
"train_speed(iter/s)": 0.774014
},
{
"epoch": 1.9951178293118017,
"grad_norm": 0.01766207069158554,
"learning_rate": 7.763269822104828e-05,
"loss": 0.0033148117065429686,
"memory(GiB)": 6.98,
"step": 85000,
"train_speed(iter/s)": 0.774037
},
{
"epoch": 2.0185898037742933,
"grad_norm": 0.01713554933667183,
"learning_rate": 7.699234675171733e-05,
"loss": 0.0030324079990386964,
"memory(GiB)": 6.98,
"step": 86000,
"train_speed(iter/s)": 0.774048
},
{
"epoch": 2.042061778236785,
"grad_norm": 0.013976668007671833,
"learning_rate": 7.634609006591897e-05,
"loss": 0.003005488157272339,
"memory(GiB)": 6.98,
"step": 87000,
"train_speed(iter/s)": 0.774045
},
{
"epoch": 2.065533752699277,
"grad_norm": 0.016621757298707962,
"learning_rate": 7.569410169154753e-05,
"loss": 0.0029498913288116455,
"memory(GiB)": 6.98,
"step": 88000,
"train_speed(iter/s)": 0.774066
},
{
"epoch": 2.089005727161769,
"grad_norm": 0.018329093232750893,
"learning_rate": 7.503655669552645e-05,
"loss": 0.002939234495162964,
"memory(GiB)": 6.98,
"step": 89000,
"train_speed(iter/s)": 0.774083
},
{
"epoch": 2.1124777016242606,
"grad_norm": 0.015152780339121819,
"learning_rate": 7.437363163680062e-05,
"loss": 0.002936884880065918,
"memory(GiB)": 6.98,
"step": 90000,
"train_speed(iter/s)": 0.774101
},
{
"epoch": 2.1359496760867525,
"grad_norm": 0.015974607318639755,
"learning_rate": 7.370550451892821e-05,
"loss": 0.0029249610900878905,
"memory(GiB)": 6.98,
"step": 91000,
"train_speed(iter/s)": 0.774085
},
{
"epoch": 2.1594216505492443,
"grad_norm": 0.015852967277169228,
"learning_rate": 7.303235474228438e-05,
"loss": 0.002932825565338135,
"memory(GiB)": 6.98,
"step": 92000,
"train_speed(iter/s)": 0.774102
},
{
"epoch": 2.182893625011736,
"grad_norm": 0.01762154884636402,
"learning_rate": 7.235436305589022e-05,
"loss": 0.0029134016036987303,
"memory(GiB)": 6.98,
"step": 93000,
"train_speed(iter/s)": 0.774122
},
{
"epoch": 2.206365599474228,
"grad_norm": 0.015959545969963074,
"learning_rate": 7.167171150887925e-05,
"loss": 0.0028825931549072265,
"memory(GiB)": 6.98,
"step": 94000,
"train_speed(iter/s)": 0.774141
},
{
"epoch": 2.2298375739367193,
"grad_norm": 0.015715470537543297,
"learning_rate": 7.098458340161515e-05,
"loss": 0.0028703656196594238,
"memory(GiB)": 6.98,
"step": 95000,
"train_speed(iter/s)": 0.77414
},
{
"epoch": 2.253309548399211,
"grad_norm": 0.016771333292126656,
"learning_rate": 7.029316323647323e-05,
"loss": 0.002838578224182129,
"memory(GiB)": 6.98,
"step": 96000,
"train_speed(iter/s)": 0.774157
},
{
"epoch": 2.276781522861703,
"grad_norm": 0.016036123037338257,
"learning_rate": 6.959763666829929e-05,
"loss": 0.002816756010055542,
"memory(GiB)": 6.98,
"step": 97000,
"train_speed(iter/s)": 0.774175
},
{
"epoch": 2.300253497324195,
"grad_norm": 0.016275903210043907,
"learning_rate": 6.889819045455897e-05,
"loss": 0.0028202550411224364,
"memory(GiB)": 6.98,
"step": 98000,
"train_speed(iter/s)": 0.774194
},
{
"epoch": 2.3237254717866866,
"grad_norm": 0.017884111031889915,
"learning_rate": 6.819501240519123e-05,
"loss": 0.0027893705368041994,
"memory(GiB)": 6.98,
"step": 99000,
"train_speed(iter/s)": 0.774193
},
{
"epoch": 2.3471974462491785,
"grad_norm": 0.014025064185261726,
"learning_rate": 6.748829133217883e-05,
"loss": 0.0027697300910949707,
"memory(GiB)": 6.98,
"step": 100000,
"train_speed(iter/s)": 0.774207
},
{
"epoch": 2.3706694207116703,
"grad_norm": 0.015192331746220589,
"learning_rate": 6.677821699885013e-05,
"loss": 0.0027350437641143798,
"memory(GiB)": 6.98,
"step": 101000,
"train_speed(iter/s)": 0.774213
},
{
"epoch": 2.394141395174162,
"grad_norm": 0.017220275476574898,
"learning_rate": 6.606498006892529e-05,
"loss": 0.0027179737091064453,
"memory(GiB)": 6.98,
"step": 102000,
"train_speed(iter/s)": 0.774219
},
{
"epoch": 2.417613369636654,
"grad_norm": 0.014982237480580807,
"learning_rate": 6.534877205532066e-05,
"loss": 0.0027117106914520263,
"memory(GiB)": 6.98,
"step": 103000,
"train_speed(iter/s)": 0.774223
},
{
"epoch": 2.441085344099146,
"grad_norm": 0.01657899282872677,
"learning_rate": 6.46297852687252e-05,
"loss": 0.002669137477874756,
"memory(GiB)": 6.98,
"step": 104000,
"train_speed(iter/s)": 0.774237
},
{
"epoch": 2.4645573185616376,
"grad_norm": 0.014530532993376255,
"learning_rate": 6.390821276596275e-05,
"loss": 0.0026637067794799806,
"memory(GiB)": 6.98,
"step": 105000,
"train_speed(iter/s)": 0.77425
},
{
"epoch": 2.488029293024129,
"grad_norm": 0.014401126652956009,
"learning_rate": 6.318424829815378e-05,
"loss": 0.0026284523010253907,
"memory(GiB)": 6.98,
"step": 106000,
"train_speed(iter/s)": 0.774248
},
{
"epoch": 2.511501267486621,
"grad_norm": 0.015307126566767693,
"learning_rate": 6.245808625869092e-05,
"loss": 0.002627563953399658,
"memory(GiB)": 6.98,
"step": 107000,
"train_speed(iter/s)": 0.77426
},
{
"epoch": 2.5349732419491127,
"grad_norm": 0.013359596021473408,
"learning_rate": 6.172992163104197e-05,
"loss": 0.0025958011150360107,
"memory(GiB)": 6.98,
"step": 108000,
"train_speed(iter/s)": 0.774275
},
{
"epoch": 2.5584452164116045,
"grad_norm": 0.014231828972697258,
"learning_rate": 6.099994993639427e-05,
"loss": 0.0025813415050506593,
"memory(GiB)": 6.98,
"step": 109000,
"train_speed(iter/s)": 0.77429
},
{
"epoch": 2.5819171908740963,
"grad_norm": 0.013382998295128345,
"learning_rate": 6.026836718115498e-05,
"loss": 0.002545518398284912,
"memory(GiB)": 6.98,
"step": 110000,
"train_speed(iter/s)": 0.774287
},
{
"epoch": 2.605389165336588,
"grad_norm": 0.015323769301176071,
"learning_rate": 5.9535369804320926e-05,
"loss": 0.002501321792602539,
"memory(GiB)": 6.98,
"step": 111000,
"train_speed(iter/s)": 0.77429
},
{
"epoch": 2.62886113979908,
"grad_norm": 0.01541207917034626,
"learning_rate": 5.8801154624732304e-05,
"loss": 0.002507776737213135,
"memory(GiB)": 6.98,
"step": 112000,
"train_speed(iter/s)": 0.774306
},
{
"epoch": 2.652333114261572,
"grad_norm": 0.01272345520555973,
"learning_rate": 5.80659187882243e-05,
"loss": 0.002472550392150879,
"memory(GiB)": 6.98,
"step": 113000,
"train_speed(iter/s)": 0.774322
},
{
"epoch": 2.675805088724063,
"grad_norm": 0.015101990662515163,
"learning_rate": 5.732985971469115e-05,
"loss": 0.002463550806045532,
"memory(GiB)": 6.98,
"step": 114000,
"train_speed(iter/s)": 0.774317
},
{
"epoch": 2.699277063186555,
"grad_norm": 0.01410239189863205,
"learning_rate": 5.6593175045076366e-05,
"loss": 0.002457813024520874,
"memory(GiB)": 6.98,
"step": 115000,
"train_speed(iter/s)": 0.774331
},
{
"epoch": 2.722749037649047,
"grad_norm": 0.012494049966335297,
"learning_rate": 5.58560625883037e-05,
"loss": 0.0024216713905334474,
"memory(GiB)": 6.98,
"step": 116000,
"train_speed(iter/s)": 0.774346
},
{
"epoch": 2.7462210121115387,
"grad_norm": 0.01646961271762848,
"learning_rate": 5.51187202681631e-05,
"loss": 0.002399977445602417,
"memory(GiB)": 6.98,
"step": 117000,
"train_speed(iter/s)": 0.774358
},
{
"epoch": 2.7696929865740305,
"grad_norm": 0.015637055039405823,
"learning_rate": 5.4381346070165593e-05,
"loss": 0.0023709371089935304,
"memory(GiB)": 6.98,
"step": 118000,
"train_speed(iter/s)": 0.774361
},
{
"epoch": 2.7931649610365223,
"grad_norm": 0.018320417031645775,
"learning_rate": 5.3644137988381846e-05,
"loss": 0.002349804401397705,
"memory(GiB)": 6.98,
"step": 119000,
"train_speed(iter/s)": 0.774374
},
{
"epoch": 2.816636935499014,
"grad_norm": 0.016526443883776665,
"learning_rate": 5.290729397227828e-05,
"loss": 0.0023311429023742678,
"memory(GiB)": 6.98,
"step": 120000,
"train_speed(iter/s)": 0.77439
}
],
"logging_steps": 1000,
"max_steps": 213020,
"num_input_tokens_seen": 0,
"num_train_epochs": 5,
"save_steps": 10000,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 8.185900435797076e+19,
"train_batch_size": 16,
"trial_name": null,
"trial_params": null
}