Download trainer_state.json from ZJUVAI/GenesisGeo-250915a: direct link, hf CLI and curl.
- Browser
- Download file 31.8 kB
-
https://huggingface.co/ZJUVAI/GenesisGeo-250915a/resolve/main/trainer_state.json
- Command line
-
hf download hf://ZJUVAI/GenesisGeo-250915a/trainer_state.json
-
curl -L -o trainer_state.json https://huggingface.co/ZJUVAI/GenesisGeo-250915a/resolve/main/trainer_state.json
31.8 kB
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 2.816636935499014, | |
| "eval_steps": 10000.0, | |
| "global_step": 120000, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 2.3471974462491784e-05, | |
| "grad_norm": 6.873311519622803, | |
| "learning_rate": 4.694394892498357e-09, | |
| "loss": 0.9773223996162415, | |
| "memory(GiB)": 6.34, | |
| "step": 1, | |
| "train_speed(iter/s)": 0.134689 | |
| }, | |
| { | |
| "epoch": 0.023471974462491784, | |
| "grad_norm": 0.7090998291969299, | |
| "learning_rate": 4.694394892498357e-06, | |
| "loss": 0.2067977095748092, | |
| "memory(GiB)": 6.98, | |
| "step": 1000, | |
| "train_speed(iter/s)": 0.770601 | |
| }, | |
| { | |
| "epoch": 0.04694394892498357, | |
| "grad_norm": 0.5364481806755066, | |
| "learning_rate": 9.388789784996714e-06, | |
| "loss": 0.044086185455322266, | |
| "memory(GiB)": 6.98, | |
| "step": 2000, | |
| "train_speed(iter/s)": 0.772463 | |
| }, | |
| { | |
| "epoch": 0.07041592338747535, | |
| "grad_norm": 0.35766565799713135, | |
| "learning_rate": 1.408318467749507e-05, | |
| "loss": 0.031457195281982424, | |
| "memory(GiB)": 6.98, | |
| "step": 3000, | |
| "train_speed(iter/s)": 0.773056 | |
| }, | |
| { | |
| "epoch": 0.09388789784996714, | |
| "grad_norm": 0.20579440891742706, | |
| "learning_rate": 1.8777579569993428e-05, | |
| "loss": 0.025429149627685547, | |
| "memory(GiB)": 6.98, | |
| "step": 4000, | |
| "train_speed(iter/s)": 0.773119 | |
| }, | |
| { | |
| "epoch": 0.11735987231245892, | |
| "grad_norm": 0.22555053234100342, | |
| "learning_rate": 2.3471974462491787e-05, | |
| "loss": 0.021895978927612306, | |
| "memory(GiB)": 6.98, | |
| "step": 5000, | |
| "train_speed(iter/s)": 0.773348 | |
| }, | |
| { | |
| "epoch": 0.1408318467749507, | |
| "grad_norm": 0.15718838572502136, | |
| "learning_rate": 2.816636935499014e-05, | |
| "loss": 0.01944416618347168, | |
| "memory(GiB)": 6.98, | |
| "step": 6000, | |
| "train_speed(iter/s)": 0.773516 | |
| }, | |
| { | |
| "epoch": 0.1643038212374425, | |
| "grad_norm": 0.129106342792511, | |
| "learning_rate": 3.28607642474885e-05, | |
| "loss": 0.017256214141845704, | |
| "memory(GiB)": 6.98, | |
| "step": 7000, | |
| "train_speed(iter/s)": 0.773625 | |
| }, | |
| { | |
| "epoch": 0.18777579569993427, | |
| "grad_norm": 0.12290780991315842, | |
| "learning_rate": 3.7555159139986855e-05, | |
| "loss": 0.015874351501464844, | |
| "memory(GiB)": 6.98, | |
| "step": 8000, | |
| "train_speed(iter/s)": 0.773509 | |
| }, | |
| { | |
| "epoch": 0.21124777016242607, | |
| "grad_norm": 0.08948824554681778, | |
| "learning_rate": 4.2249554032485215e-05, | |
| "loss": 0.016113059997558594, | |
| "memory(GiB)": 6.98, | |
| "step": 9000, | |
| "train_speed(iter/s)": 0.773568 | |
| }, | |
| { | |
| "epoch": 0.23471974462491785, | |
| "grad_norm": 0.0859590545296669, | |
| "learning_rate": 4.6943948924983574e-05, | |
| "loss": 0.013513467788696288, | |
| "memory(GiB)": 6.98, | |
| "step": 10000, | |
| "train_speed(iter/s)": 0.773615 | |
| }, | |
| { | |
| "epoch": 0.2581917190874096, | |
| "grad_norm": 0.06912733614444733, | |
| "learning_rate": 5.163834381748193e-05, | |
| "loss": 0.012883235931396484, | |
| "memory(GiB)": 6.98, | |
| "step": 11000, | |
| "train_speed(iter/s)": 0.773538 | |
| }, | |
| { | |
| "epoch": 0.2816636935499014, | |
| "grad_norm": 0.0689440667629242, | |
| "learning_rate": 5.633273870998028e-05, | |
| "loss": 0.012275049209594727, | |
| "memory(GiB)": 6.98, | |
| "step": 12000, | |
| "train_speed(iter/s)": 0.773456 | |
| }, | |
| { | |
| "epoch": 0.3051356680123932, | |
| "grad_norm": 0.05962664261460304, | |
| "learning_rate": 6.1027133602478646e-05, | |
| "loss": 0.011764054298400878, | |
| "memory(GiB)": 6.98, | |
| "step": 13000, | |
| "train_speed(iter/s)": 0.773525 | |
| }, | |
| { | |
| "epoch": 0.328607642474885, | |
| "grad_norm": 0.06685680896043777, | |
| "learning_rate": 6.5721528494977e-05, | |
| "loss": 0.011147622108459473, | |
| "memory(GiB)": 6.98, | |
| "step": 14000, | |
| "train_speed(iter/s)": 0.773587 | |
| }, | |
| { | |
| "epoch": 0.35207961693737677, | |
| "grad_norm": 0.055886879563331604, | |
| "learning_rate": 7.041592338747535e-05, | |
| "loss": 0.010751012802124024, | |
| "memory(GiB)": 6.98, | |
| "step": 15000, | |
| "train_speed(iter/s)": 0.773522 | |
| }, | |
| { | |
| "epoch": 0.37555159139986855, | |
| "grad_norm": 0.05007677897810936, | |
| "learning_rate": 7.511031827997371e-05, | |
| "loss": 0.010270029067993165, | |
| "memory(GiB)": 6.98, | |
| "step": 16000, | |
| "train_speed(iter/s)": 0.773572 | |
| }, | |
| { | |
| "epoch": 0.3990235658623603, | |
| "grad_norm": 0.04750866815447807, | |
| "learning_rate": 7.980471317247207e-05, | |
| "loss": 0.014723161697387695, | |
| "memory(GiB)": 6.98, | |
| "step": 17000, | |
| "train_speed(iter/s)": 0.77362 | |
| }, | |
| { | |
| "epoch": 0.42249554032485215, | |
| "grad_norm": 0.0429859384894371, | |
| "learning_rate": 8.449910806497043e-05, | |
| "loss": 0.00955332088470459, | |
| "memory(GiB)": 6.98, | |
| "step": 18000, | |
| "train_speed(iter/s)": 0.773663 | |
| }, | |
| { | |
| "epoch": 0.4459675147873439, | |
| "grad_norm": 0.04136689752340317, | |
| "learning_rate": 8.919350295746879e-05, | |
| "loss": 0.008662021636962891, | |
| "memory(GiB)": 6.98, | |
| "step": 19000, | |
| "train_speed(iter/s)": 0.773622 | |
| }, | |
| { | |
| "epoch": 0.4694394892498357, | |
| "grad_norm": 0.037089236080646515, | |
| "learning_rate": 9.388789784996715e-05, | |
| "loss": 0.00884601593017578, | |
| "memory(GiB)": 6.98, | |
| "step": 20000, | |
| "train_speed(iter/s)": 0.773654 | |
| }, | |
| { | |
| "epoch": 0.49291146371232747, | |
| "grad_norm": 0.04602020978927612, | |
| "learning_rate": 9.85822927424655e-05, | |
| "loss": 0.008930742263793945, | |
| "memory(GiB)": 6.98, | |
| "step": 21000, | |
| "train_speed(iter/s)": 0.773619 | |
| }, | |
| { | |
| "epoch": 0.5163834381748192, | |
| "grad_norm": 0.03754112869501114, | |
| "learning_rate": 9.9997056509798e-05, | |
| "loss": 0.008811912536621093, | |
| "memory(GiB)": 6.98, | |
| "step": 22000, | |
| "train_speed(iter/s)": 0.773654 | |
| }, | |
| { | |
| "epoch": 0.5398554126373111, | |
| "grad_norm": 0.038691937923431396, | |
| "learning_rate": 9.998258177739357e-05, | |
| "loss": 0.008538522720336915, | |
| "memory(GiB)": 6.98, | |
| "step": 23000, | |
| "train_speed(iter/s)": 0.773604 | |
| }, | |
| { | |
| "epoch": 0.5633273870998028, | |
| "grad_norm": 0.035799555480480194, | |
| "learning_rate": 9.995602866673978e-05, | |
| "loss": 0.008209162712097168, | |
| "memory(GiB)": 6.98, | |
| "step": 24000, | |
| "train_speed(iter/s)": 0.773623 | |
| }, | |
| { | |
| "epoch": 0.5867993615622946, | |
| "grad_norm": 0.029186313971877098, | |
| "learning_rate": 9.99174043076745e-05, | |
| "loss": 0.012456470489501954, | |
| "memory(GiB)": 6.98, | |
| "step": 25000, | |
| "train_speed(iter/s)": 0.773622 | |
| }, | |
| { | |
| "epoch": 0.6102713360247864, | |
| "grad_norm": 0.030947748571634293, | |
| "learning_rate": 9.98667190713147e-05, | |
| "loss": 0.0070707683563232425, | |
| "memory(GiB)": 6.98, | |
| "step": 26000, | |
| "train_speed(iter/s)": 0.773612 | |
| }, | |
| { | |
| "epoch": 0.6337433104872782, | |
| "grad_norm": 0.2330833226442337, | |
| "learning_rate": 9.980398656727177e-05, | |
| "loss": 0.006968212127685547, | |
| "memory(GiB)": 6.98, | |
| "step": 27000, | |
| "train_speed(iter/s)": 0.773568 | |
| }, | |
| { | |
| "epoch": 0.65721528494977, | |
| "grad_norm": 0.028112607076764107, | |
| "learning_rate": 9.97292236399971e-05, | |
| "loss": 0.007095534801483155, | |
| "memory(GiB)": 6.98, | |
| "step": 28000, | |
| "train_speed(iter/s)": 0.773592 | |
| }, | |
| { | |
| "epoch": 0.6806872594122617, | |
| "grad_norm": 0.02619938738644123, | |
| "learning_rate": 9.964245036425917e-05, | |
| "loss": 0.008339838981628418, | |
| "memory(GiB)": 6.98, | |
| "step": 29000, | |
| "train_speed(iter/s)": 0.773625 | |
| }, | |
| { | |
| "epoch": 0.7041592338747535, | |
| "grad_norm": 0.025133736431598663, | |
| "learning_rate": 9.954369003975321e-05, | |
| "loss": 0.0064864115715026855, | |
| "memory(GiB)": 6.98, | |
| "step": 30000, | |
| "train_speed(iter/s)": 0.773609 | |
| }, | |
| { | |
| "epoch": 0.7276312083372454, | |
| "grad_norm": 0.027932610362768173, | |
| "learning_rate": 9.943296918484496e-05, | |
| "loss": 0.006537047863006592, | |
| "memory(GiB)": 6.98, | |
| "step": 31000, | |
| "train_speed(iter/s)": 0.773583 | |
| }, | |
| { | |
| "epoch": 0.7511031827997371, | |
| "grad_norm": 0.025137219578027725, | |
| "learning_rate": 9.931031752945016e-05, | |
| "loss": 0.006564114570617676, | |
| "memory(GiB)": 6.98, | |
| "step": 32000, | |
| "train_speed(iter/s)": 0.773606 | |
| }, | |
| { | |
| "epoch": 0.7745751572622289, | |
| "grad_norm": 0.025504019111394882, | |
| "learning_rate": 9.917576800705166e-05, | |
| "loss": 0.006496795654296875, | |
| "memory(GiB)": 6.98, | |
| "step": 33000, | |
| "train_speed(iter/s)": 0.773632 | |
| }, | |
| { | |
| "epoch": 0.7980471317247206, | |
| "grad_norm": 0.02448360249400139, | |
| "learning_rate": 9.902935674585645e-05, | |
| "loss": 0.006350491523742676, | |
| "memory(GiB)": 6.98, | |
| "step": 34000, | |
| "train_speed(iter/s)": 0.773604 | |
| }, | |
| { | |
| "epoch": 0.8215191061872125, | |
| "grad_norm": 0.025678610429167747, | |
| "learning_rate": 9.887112305909476e-05, | |
| "loss": 0.006270767211914063, | |
| "memory(GiB)": 6.98, | |
| "step": 35000, | |
| "train_speed(iter/s)": 0.773637 | |
| }, | |
| { | |
| "epoch": 0.8449910806497043, | |
| "grad_norm": 0.020809423178434372, | |
| "learning_rate": 9.870110943446392e-05, | |
| "loss": 0.006130220413208008, | |
| "memory(GiB)": 6.98, | |
| "step": 36000, | |
| "train_speed(iter/s)": 0.773667 | |
| }, | |
| { | |
| "epoch": 0.868463055112196, | |
| "grad_norm": 0.02085060253739357, | |
| "learning_rate": 9.851936152271996e-05, | |
| "loss": 0.005994909763336181, | |
| "memory(GiB)": 6.98, | |
| "step": 37000, | |
| "train_speed(iter/s)": 0.7737 | |
| }, | |
| { | |
| "epoch": 0.8919350295746878, | |
| "grad_norm": 0.023238450288772583, | |
| "learning_rate": 9.832592812541974e-05, | |
| "loss": 0.005881279468536377, | |
| "memory(GiB)": 6.98, | |
| "step": 38000, | |
| "train_speed(iter/s)": 0.773678 | |
| }, | |
| { | |
| "epoch": 0.9154070040371796, | |
| "grad_norm": 0.022812778130173683, | |
| "learning_rate": 9.812086118181725e-05, | |
| "loss": 0.005744485855102539, | |
| "memory(GiB)": 6.98, | |
| "step": 39000, | |
| "train_speed(iter/s)": 0.773711 | |
| }, | |
| { | |
| "epoch": 0.9388789784996714, | |
| "grad_norm": 0.022495215758681297, | |
| "learning_rate": 9.790421575491719e-05, | |
| "loss": 0.005901573181152343, | |
| "memory(GiB)": 6.98, | |
| "step": 40000, | |
| "train_speed(iter/s)": 0.773731 | |
| }, | |
| { | |
| "epoch": 0.9623509529621632, | |
| "grad_norm": 0.02446814998984337, | |
| "learning_rate": 9.767605001668988e-05, | |
| "loss": 0.005200364112854004, | |
| "memory(GiB)": 6.98, | |
| "step": 41000, | |
| "train_speed(iter/s)": 0.773715 | |
| }, | |
| { | |
| "epoch": 0.9858229274246549, | |
| "grad_norm": 0.020658565685153008, | |
| "learning_rate": 9.743642523245135e-05, | |
| "loss": 0.005229688167572021, | |
| "memory(GiB)": 6.98, | |
| "step": 42000, | |
| "train_speed(iter/s)": 0.773696 | |
| }, | |
| { | |
| "epoch": 1.0092949018871467, | |
| "grad_norm": 0.021865155547857285, | |
| "learning_rate": 9.718540574441292e-05, | |
| "loss": 0.005165683746337891, | |
| "memory(GiB)": 6.98, | |
| "step": 43000, | |
| "train_speed(iter/s)": 0.773678 | |
| }, | |
| { | |
| "epoch": 1.0327668763496385, | |
| "grad_norm": 0.0181892029941082, | |
| "learning_rate": 9.692305895440446e-05, | |
| "loss": 0.005038617134094238, | |
| "memory(GiB)": 6.98, | |
| "step": 44000, | |
| "train_speed(iter/s)": 0.77369 | |
| }, | |
| { | |
| "epoch": 1.0562388508121303, | |
| "grad_norm": 0.020988518372178078, | |
| "learning_rate": 9.664945530577624e-05, | |
| "loss": 0.005030522346496582, | |
| "memory(GiB)": 6.98, | |
| "step": 45000, | |
| "train_speed(iter/s)": 0.773703 | |
| }, | |
| { | |
| "epoch": 1.0797108252746221, | |
| "grad_norm": 0.01870891824364662, | |
| "learning_rate": 9.636466826448388e-05, | |
| "loss": 0.004962910175323487, | |
| "memory(GiB)": 6.98, | |
| "step": 46000, | |
| "train_speed(iter/s)": 0.77367 | |
| }, | |
| { | |
| "epoch": 1.103182799737114, | |
| "grad_norm": 0.020105397328734398, | |
| "learning_rate": 9.6068774299362e-05, | |
| "loss": 0.004928079128265381, | |
| "memory(GiB)": 6.98, | |
| "step": 47000, | |
| "train_speed(iter/s)": 0.773684 | |
| }, | |
| { | |
| "epoch": 1.1266547741996056, | |
| "grad_norm": 0.017308305948972702, | |
| "learning_rate": 9.576185286159124e-05, | |
| "loss": 0.004844691276550293, | |
| "memory(GiB)": 6.98, | |
| "step": 48000, | |
| "train_speed(iter/s)": 0.773704 | |
| }, | |
| { | |
| "epoch": 1.1501267486620974, | |
| "grad_norm": 0.02030794508755207, | |
| "learning_rate": 9.54439863633648e-05, | |
| "loss": 0.004808475494384765, | |
| "memory(GiB)": 6.98, | |
| "step": 49000, | |
| "train_speed(iter/s)": 0.773693 | |
| }, | |
| { | |
| "epoch": 1.1735987231245892, | |
| "grad_norm": 0.021403463557362556, | |
| "learning_rate": 9.511526015575962e-05, | |
| "loss": 0.0047379093170166016, | |
| "memory(GiB)": 6.98, | |
| "step": 50000, | |
| "train_speed(iter/s)": 0.773715 | |
| }, | |
| { | |
| "epoch": 1.197070697587081, | |
| "grad_norm": 0.02005721814930439, | |
| "learning_rate": 9.477576250581859e-05, | |
| "loss": 0.004678564548492432, | |
| "memory(GiB)": 6.98, | |
| "step": 51000, | |
| "train_speed(iter/s)": 0.773696 | |
| }, | |
| { | |
| "epoch": 1.220542672049573, | |
| "grad_norm": 0.019888877868652344, | |
| "learning_rate": 9.442558457284981e-05, | |
| "loss": 0.004646867275238037, | |
| "memory(GiB)": 6.98, | |
| "step": 52000, | |
| "train_speed(iter/s)": 0.773713 | |
| }, | |
| { | |
| "epoch": 1.2440146465120645, | |
| "grad_norm": 0.01766289584338665, | |
| "learning_rate": 9.406482038394913e-05, | |
| "loss": 0.005699957847595215, | |
| "memory(GiB)": 6.98, | |
| "step": 53000, | |
| "train_speed(iter/s)": 0.773705 | |
| }, | |
| { | |
| "epoch": 1.2674866209745563, | |
| "grad_norm": 0.01960998773574829, | |
| "learning_rate": 9.369356680875276e-05, | |
| "loss": 0.004132438182830811, | |
| "memory(GiB)": 6.98, | |
| "step": 54000, | |
| "train_speed(iter/s)": 0.773731 | |
| }, | |
| { | |
| "epoch": 1.2909585954370482, | |
| "grad_norm": 0.01634296402335167, | |
| "learning_rate": 9.331192353342657e-05, | |
| "loss": 0.0040699739456176755, | |
| "memory(GiB)": 6.98, | |
| "step": 55000, | |
| "train_speed(iter/s)": 0.773755 | |
| }, | |
| { | |
| "epoch": 1.31443056989954, | |
| "grad_norm": 0.019385425373911858, | |
| "learning_rate": 9.291999303389908e-05, | |
| "loss": 0.004208338260650635, | |
| "memory(GiB)": 6.98, | |
| "step": 56000, | |
| "train_speed(iter/s)": 0.773776 | |
| }, | |
| { | |
| "epoch": 1.3379025443620316, | |
| "grad_norm": 0.01933792047202587, | |
| "learning_rate": 9.251788054834548e-05, | |
| "loss": 0.0042822351455688475, | |
| "memory(GiB)": 6.98, | |
| "step": 57000, | |
| "train_speed(iter/s)": 0.773762 | |
| }, | |
| { | |
| "epoch": 1.3613745188245234, | |
| "grad_norm": 0.018314572051167488, | |
| "learning_rate": 9.210569404892982e-05, | |
| "loss": 0.004284262657165527, | |
| "memory(GiB)": 6.98, | |
| "step": 58000, | |
| "train_speed(iter/s)": 0.773784 | |
| }, | |
| { | |
| "epoch": 1.3848464932870153, | |
| "grad_norm": 0.0157700777053833, | |
| "learning_rate": 9.168354421281314e-05, | |
| "loss": 0.004284625053405762, | |
| "memory(GiB)": 6.98, | |
| "step": 59000, | |
| "train_speed(iter/s)": 0.7738 | |
| }, | |
| { | |
| "epoch": 1.408318467749507, | |
| "grad_norm": 0.01911577582359314, | |
| "learning_rate": 9.125154439243543e-05, | |
| "loss": 0.004283618450164795, | |
| "memory(GiB)": 6.98, | |
| "step": 60000, | |
| "train_speed(iter/s)": 0.773821 | |
| }, | |
| { | |
| "epoch": 1.431790442211999, | |
| "grad_norm": 0.01760895363986492, | |
| "learning_rate": 9.080981058507891e-05, | |
| "loss": 0.0042250375747680665, | |
| "memory(GiB)": 6.98, | |
| "step": 61000, | |
| "train_speed(iter/s)": 0.773787 | |
| }, | |
| { | |
| "epoch": 1.4552624166744907, | |
| "grad_norm": 0.016973674297332764, | |
| "learning_rate": 9.035846140172137e-05, | |
| "loss": 0.004184374809265137, | |
| "memory(GiB)": 6.98, | |
| "step": 62000, | |
| "train_speed(iter/s)": 0.773805 | |
| }, | |
| { | |
| "epoch": 1.4787343911369826, | |
| "grad_norm": 0.018145151436328888, | |
| "learning_rate": 8.989761803518783e-05, | |
| "loss": 0.0041481399536132816, | |
| "memory(GiB)": 6.98, | |
| "step": 63000, | |
| "train_speed(iter/s)": 0.773822 | |
| }, | |
| { | |
| "epoch": 1.5022063655994742, | |
| "grad_norm": 0.018821215257048607, | |
| "learning_rate": 8.942740422760855e-05, | |
| "loss": 0.004085684776306152, | |
| "memory(GiB)": 6.98, | |
| "step": 64000, | |
| "train_speed(iter/s)": 0.773834 | |
| }, | |
| { | |
| "epoch": 1.525678340061966, | |
| "grad_norm": 0.016859283670783043, | |
| "learning_rate": 8.894794623719286e-05, | |
| "loss": 0.004074786186218262, | |
| "memory(GiB)": 6.98, | |
| "step": 65000, | |
| "train_speed(iter/s)": 0.773829 | |
| }, | |
| { | |
| "epoch": 1.5491503145244578, | |
| "grad_norm": 0.018960464745759964, | |
| "learning_rate": 8.84593728043272e-05, | |
| "loss": 0.004000515460968018, | |
| "memory(GiB)": 6.98, | |
| "step": 66000, | |
| "train_speed(iter/s)": 0.773845 | |
| }, | |
| { | |
| "epoch": 1.5726222889869494, | |
| "grad_norm": 0.01604197360575199, | |
| "learning_rate": 8.796181511700688e-05, | |
| "loss": 0.00393418288230896, | |
| "memory(GiB)": 6.98, | |
| "step": 67000, | |
| "train_speed(iter/s)": 0.773862 | |
| }, | |
| { | |
| "epoch": 1.5960942634494413, | |
| "grad_norm": 0.018188416957855225, | |
| "learning_rate": 8.745540677561029e-05, | |
| "loss": 0.00391404390335083, | |
| "memory(GiB)": 6.98, | |
| "step": 68000, | |
| "train_speed(iter/s)": 0.773854 | |
| }, | |
| { | |
| "epoch": 1.619566237911933, | |
| "grad_norm": 0.016790760681033134, | |
| "learning_rate": 8.694028375702572e-05, | |
| "loss": 0.0038784058094024658, | |
| "memory(GiB)": 6.98, | |
| "step": 69000, | |
| "train_speed(iter/s)": 0.773863 | |
| }, | |
| { | |
| "epoch": 1.643038212374425, | |
| "grad_norm": 0.017686154693365097, | |
| "learning_rate": 8.641658437813977e-05, | |
| "loss": 0.0038486015796661377, | |
| "memory(GiB)": 6.98, | |
| "step": 70000, | |
| "train_speed(iter/s)": 0.773875 | |
| }, | |
| { | |
| "epoch": 1.6665101868369168, | |
| "grad_norm": 0.016662968322634697, | |
| "learning_rate": 8.588444925869765e-05, | |
| "loss": 0.003811450719833374, | |
| "memory(GiB)": 6.98, | |
| "step": 71000, | |
| "train_speed(iter/s)": 0.773869 | |
| }, | |
| { | |
| "epoch": 1.6899821612994086, | |
| "grad_norm": 0.01588079333305359, | |
| "learning_rate": 8.53440212835449e-05, | |
| "loss": 0.0037576057910919188, | |
| "memory(GiB)": 6.98, | |
| "step": 72000, | |
| "train_speed(iter/s)": 0.773859 | |
| }, | |
| { | |
| "epoch": 1.7134541357619004, | |
| "grad_norm": 0.017528703436255455, | |
| "learning_rate": 8.479544556426129e-05, | |
| "loss": 0.0037284982204437256, | |
| "memory(GiB)": 6.98, | |
| "step": 73000, | |
| "train_speed(iter/s)": 0.773877 | |
| }, | |
| { | |
| "epoch": 1.736926110224392, | |
| "grad_norm": 0.016123304143548012, | |
| "learning_rate": 8.423886940019631e-05, | |
| "loss": 0.003685460567474365, | |
| "memory(GiB)": 6.98, | |
| "step": 74000, | |
| "train_speed(iter/s)": 0.773895 | |
| }, | |
| { | |
| "epoch": 1.7603980846868839, | |
| "grad_norm": 0.016363080590963364, | |
| "learning_rate": 8.367444223891764e-05, | |
| "loss": 0.003638455867767334, | |
| "memory(GiB)": 6.98, | |
| "step": 75000, | |
| "train_speed(iter/s)": 0.773914 | |
| }, | |
| { | |
| "epoch": 1.7838700591493757, | |
| "grad_norm": 0.017023220658302307, | |
| "learning_rate": 8.310231563608256e-05, | |
| "loss": 0.003618378162384033, | |
| "memory(GiB)": 6.98, | |
| "step": 76000, | |
| "train_speed(iter/s)": 0.773913 | |
| }, | |
| { | |
| "epoch": 1.8073420336118673, | |
| "grad_norm": 0.018276922404766083, | |
| "learning_rate": 8.252264321474346e-05, | |
| "loss": 0.0035556938648223877, | |
| "memory(GiB)": 6.98, | |
| "step": 77000, | |
| "train_speed(iter/s)": 0.773935 | |
| }, | |
| { | |
| "epoch": 1.8308140080743591, | |
| "grad_norm": 0.018186427652835846, | |
| "learning_rate": 8.193558062409806e-05, | |
| "loss": 0.0035327181816101074, | |
| "memory(GiB)": 6.98, | |
| "step": 78000, | |
| "train_speed(iter/s)": 0.77396 | |
| }, | |
| { | |
| "epoch": 1.854285982536851, | |
| "grad_norm": 0.01577594503760338, | |
| "learning_rate": 8.134128549769571e-05, | |
| "loss": 0.0034980549812316897, | |
| "memory(GiB)": 6.98, | |
| "step": 79000, | |
| "train_speed(iter/s)": 0.773984 | |
| }, | |
| { | |
| "epoch": 1.8777579569993428, | |
| "grad_norm": 0.016289088875055313, | |
| "learning_rate": 8.073991741111093e-05, | |
| "loss": 0.0034754557609558106, | |
| "memory(GiB)": 6.98, | |
| "step": 80000, | |
| "train_speed(iter/s)": 0.773982 | |
| }, | |
| { | |
| "epoch": 1.9012299314618346, | |
| "grad_norm": 0.014553467743098736, | |
| "learning_rate": 8.013163783909524e-05, | |
| "loss": 0.0034601585865020753, | |
| "memory(GiB)": 6.98, | |
| "step": 81000, | |
| "train_speed(iter/s)": 0.773986 | |
| }, | |
| { | |
| "epoch": 1.9247019059243264, | |
| "grad_norm": 0.01678823120892048, | |
| "learning_rate": 7.951661011221935e-05, | |
| "loss": 0.0034030678272247315, | |
| "memory(GiB)": 6.98, | |
| "step": 82000, | |
| "train_speed(iter/s)": 0.774 | |
| }, | |
| { | |
| "epoch": 1.9481738803868183, | |
| "grad_norm": 0.01649617776274681, | |
| "learning_rate": 7.889499937301675e-05, | |
| "loss": 0.0033872227668762206, | |
| "memory(GiB)": 6.98, | |
| "step": 83000, | |
| "train_speed(iter/s)": 0.774008 | |
| }, | |
| { | |
| "epoch": 1.9716458548493099, | |
| "grad_norm": 0.015564069151878357, | |
| "learning_rate": 7.8266972531641e-05, | |
| "loss": 0.0033475735187530518, | |
| "memory(GiB)": 6.98, | |
| "step": 84000, | |
| "train_speed(iter/s)": 0.774014 | |
| }, | |
| { | |
| "epoch": 1.9951178293118017, | |
| "grad_norm": 0.01766207069158554, | |
| "learning_rate": 7.763269822104828e-05, | |
| "loss": 0.0033148117065429686, | |
| "memory(GiB)": 6.98, | |
| "step": 85000, | |
| "train_speed(iter/s)": 0.774037 | |
| }, | |
| { | |
| "epoch": 2.0185898037742933, | |
| "grad_norm": 0.01713554933667183, | |
| "learning_rate": 7.699234675171733e-05, | |
| "loss": 0.0030324079990386964, | |
| "memory(GiB)": 6.98, | |
| "step": 86000, | |
| "train_speed(iter/s)": 0.774048 | |
| }, | |
| { | |
| "epoch": 2.042061778236785, | |
| "grad_norm": 0.013976668007671833, | |
| "learning_rate": 7.634609006591897e-05, | |
| "loss": 0.003005488157272339, | |
| "memory(GiB)": 6.98, | |
| "step": 87000, | |
| "train_speed(iter/s)": 0.774045 | |
| }, | |
| { | |
| "epoch": 2.065533752699277, | |
| "grad_norm": 0.016621757298707962, | |
| "learning_rate": 7.569410169154753e-05, | |
| "loss": 0.0029498913288116455, | |
| "memory(GiB)": 6.98, | |
| "step": 88000, | |
| "train_speed(iter/s)": 0.774066 | |
| }, | |
| { | |
| "epoch": 2.089005727161769, | |
| "grad_norm": 0.018329093232750893, | |
| "learning_rate": 7.503655669552645e-05, | |
| "loss": 0.002939234495162964, | |
| "memory(GiB)": 6.98, | |
| "step": 89000, | |
| "train_speed(iter/s)": 0.774083 | |
| }, | |
| { | |
| "epoch": 2.1124777016242606, | |
| "grad_norm": 0.015152780339121819, | |
| "learning_rate": 7.437363163680062e-05, | |
| "loss": 0.002936884880065918, | |
| "memory(GiB)": 6.98, | |
| "step": 90000, | |
| "train_speed(iter/s)": 0.774101 | |
| }, | |
| { | |
| "epoch": 2.1359496760867525, | |
| "grad_norm": 0.015974607318639755, | |
| "learning_rate": 7.370550451892821e-05, | |
| "loss": 0.0029249610900878905, | |
| "memory(GiB)": 6.98, | |
| "step": 91000, | |
| "train_speed(iter/s)": 0.774085 | |
| }, | |
| { | |
| "epoch": 2.1594216505492443, | |
| "grad_norm": 0.015852967277169228, | |
| "learning_rate": 7.303235474228438e-05, | |
| "loss": 0.002932825565338135, | |
| "memory(GiB)": 6.98, | |
| "step": 92000, | |
| "train_speed(iter/s)": 0.774102 | |
| }, | |
| { | |
| "epoch": 2.182893625011736, | |
| "grad_norm": 0.01762154884636402, | |
| "learning_rate": 7.235436305589022e-05, | |
| "loss": 0.0029134016036987303, | |
| "memory(GiB)": 6.98, | |
| "step": 93000, | |
| "train_speed(iter/s)": 0.774122 | |
| }, | |
| { | |
| "epoch": 2.206365599474228, | |
| "grad_norm": 0.015959545969963074, | |
| "learning_rate": 7.167171150887925e-05, | |
| "loss": 0.0028825931549072265, | |
| "memory(GiB)": 6.98, | |
| "step": 94000, | |
| "train_speed(iter/s)": 0.774141 | |
| }, | |
| { | |
| "epoch": 2.2298375739367193, | |
| "grad_norm": 0.015715470537543297, | |
| "learning_rate": 7.098458340161515e-05, | |
| "loss": 0.0028703656196594238, | |
| "memory(GiB)": 6.98, | |
| "step": 95000, | |
| "train_speed(iter/s)": 0.77414 | |
| }, | |
| { | |
| "epoch": 2.253309548399211, | |
| "grad_norm": 0.016771333292126656, | |
| "learning_rate": 7.029316323647323e-05, | |
| "loss": 0.002838578224182129, | |
| "memory(GiB)": 6.98, | |
| "step": 96000, | |
| "train_speed(iter/s)": 0.774157 | |
| }, | |
| { | |
| "epoch": 2.276781522861703, | |
| "grad_norm": 0.016036123037338257, | |
| "learning_rate": 6.959763666829929e-05, | |
| "loss": 0.002816756010055542, | |
| "memory(GiB)": 6.98, | |
| "step": 97000, | |
| "train_speed(iter/s)": 0.774175 | |
| }, | |
| { | |
| "epoch": 2.300253497324195, | |
| "grad_norm": 0.016275903210043907, | |
| "learning_rate": 6.889819045455897e-05, | |
| "loss": 0.0028202550411224364, | |
| "memory(GiB)": 6.98, | |
| "step": 98000, | |
| "train_speed(iter/s)": 0.774194 | |
| }, | |
| { | |
| "epoch": 2.3237254717866866, | |
| "grad_norm": 0.017884111031889915, | |
| "learning_rate": 6.819501240519123e-05, | |
| "loss": 0.0027893705368041994, | |
| "memory(GiB)": 6.98, | |
| "step": 99000, | |
| "train_speed(iter/s)": 0.774193 | |
| }, | |
| { | |
| "epoch": 2.3471974462491785, | |
| "grad_norm": 0.014025064185261726, | |
| "learning_rate": 6.748829133217883e-05, | |
| "loss": 0.0027697300910949707, | |
| "memory(GiB)": 6.98, | |
| "step": 100000, | |
| "train_speed(iter/s)": 0.774207 | |
| }, | |
| { | |
| "epoch": 2.3706694207116703, | |
| "grad_norm": 0.015192331746220589, | |
| "learning_rate": 6.677821699885013e-05, | |
| "loss": 0.0027350437641143798, | |
| "memory(GiB)": 6.98, | |
| "step": 101000, | |
| "train_speed(iter/s)": 0.774213 | |
| }, | |
| { | |
| "epoch": 2.394141395174162, | |
| "grad_norm": 0.017220275476574898, | |
| "learning_rate": 6.606498006892529e-05, | |
| "loss": 0.0027179737091064453, | |
| "memory(GiB)": 6.98, | |
| "step": 102000, | |
| "train_speed(iter/s)": 0.774219 | |
| }, | |
| { | |
| "epoch": 2.417613369636654, | |
| "grad_norm": 0.014982237480580807, | |
| "learning_rate": 6.534877205532066e-05, | |
| "loss": 0.0027117106914520263, | |
| "memory(GiB)": 6.98, | |
| "step": 103000, | |
| "train_speed(iter/s)": 0.774223 | |
| }, | |
| { | |
| "epoch": 2.441085344099146, | |
| "grad_norm": 0.01657899282872677, | |
| "learning_rate": 6.46297852687252e-05, | |
| "loss": 0.002669137477874756, | |
| "memory(GiB)": 6.98, | |
| "step": 104000, | |
| "train_speed(iter/s)": 0.774237 | |
| }, | |
| { | |
| "epoch": 2.4645573185616376, | |
| "grad_norm": 0.014530532993376255, | |
| "learning_rate": 6.390821276596275e-05, | |
| "loss": 0.0026637067794799806, | |
| "memory(GiB)": 6.98, | |
| "step": 105000, | |
| "train_speed(iter/s)": 0.77425 | |
| }, | |
| { | |
| "epoch": 2.488029293024129, | |
| "grad_norm": 0.014401126652956009, | |
| "learning_rate": 6.318424829815378e-05, | |
| "loss": 0.0026284523010253907, | |
| "memory(GiB)": 6.98, | |
| "step": 106000, | |
| "train_speed(iter/s)": 0.774248 | |
| }, | |
| { | |
| "epoch": 2.511501267486621, | |
| "grad_norm": 0.015307126566767693, | |
| "learning_rate": 6.245808625869092e-05, | |
| "loss": 0.002627563953399658, | |
| "memory(GiB)": 6.98, | |
| "step": 107000, | |
| "train_speed(iter/s)": 0.77426 | |
| }, | |
| { | |
| "epoch": 2.5349732419491127, | |
| "grad_norm": 0.013359596021473408, | |
| "learning_rate": 6.172992163104197e-05, | |
| "loss": 0.0025958011150360107, | |
| "memory(GiB)": 6.98, | |
| "step": 108000, | |
| "train_speed(iter/s)": 0.774275 | |
| }, | |
| { | |
| "epoch": 2.5584452164116045, | |
| "grad_norm": 0.014231828972697258, | |
| "learning_rate": 6.099994993639427e-05, | |
| "loss": 0.0025813415050506593, | |
| "memory(GiB)": 6.98, | |
| "step": 109000, | |
| "train_speed(iter/s)": 0.77429 | |
| }, | |
| { | |
| "epoch": 2.5819171908740963, | |
| "grad_norm": 0.013382998295128345, | |
| "learning_rate": 6.026836718115498e-05, | |
| "loss": 0.002545518398284912, | |
| "memory(GiB)": 6.98, | |
| "step": 110000, | |
| "train_speed(iter/s)": 0.774287 | |
| }, | |
| { | |
| "epoch": 2.605389165336588, | |
| "grad_norm": 0.015323769301176071, | |
| "learning_rate": 5.9535369804320926e-05, | |
| "loss": 0.002501321792602539, | |
| "memory(GiB)": 6.98, | |
| "step": 111000, | |
| "train_speed(iter/s)": 0.77429 | |
| }, | |
| { | |
| "epoch": 2.62886113979908, | |
| "grad_norm": 0.01541207917034626, | |
| "learning_rate": 5.8801154624732304e-05, | |
| "loss": 0.002507776737213135, | |
| "memory(GiB)": 6.98, | |
| "step": 112000, | |
| "train_speed(iter/s)": 0.774306 | |
| }, | |
| { | |
| "epoch": 2.652333114261572, | |
| "grad_norm": 0.01272345520555973, | |
| "learning_rate": 5.80659187882243e-05, | |
| "loss": 0.002472550392150879, | |
| "memory(GiB)": 6.98, | |
| "step": 113000, | |
| "train_speed(iter/s)": 0.774322 | |
| }, | |
| { | |
| "epoch": 2.675805088724063, | |
| "grad_norm": 0.015101990662515163, | |
| "learning_rate": 5.732985971469115e-05, | |
| "loss": 0.002463550806045532, | |
| "memory(GiB)": 6.98, | |
| "step": 114000, | |
| "train_speed(iter/s)": 0.774317 | |
| }, | |
| { | |
| "epoch": 2.699277063186555, | |
| "grad_norm": 0.01410239189863205, | |
| "learning_rate": 5.6593175045076366e-05, | |
| "loss": 0.002457813024520874, | |
| "memory(GiB)": 6.98, | |
| "step": 115000, | |
| "train_speed(iter/s)": 0.774331 | |
| }, | |
| { | |
| "epoch": 2.722749037649047, | |
| "grad_norm": 0.012494049966335297, | |
| "learning_rate": 5.58560625883037e-05, | |
| "loss": 0.0024216713905334474, | |
| "memory(GiB)": 6.98, | |
| "step": 116000, | |
| "train_speed(iter/s)": 0.774346 | |
| }, | |
| { | |
| "epoch": 2.7462210121115387, | |
| "grad_norm": 0.01646961271762848, | |
| "learning_rate": 5.51187202681631e-05, | |
| "loss": 0.002399977445602417, | |
| "memory(GiB)": 6.98, | |
| "step": 117000, | |
| "train_speed(iter/s)": 0.774358 | |
| }, | |
| { | |
| "epoch": 2.7696929865740305, | |
| "grad_norm": 0.015637055039405823, | |
| "learning_rate": 5.4381346070165593e-05, | |
| "loss": 0.0023709371089935304, | |
| "memory(GiB)": 6.98, | |
| "step": 118000, | |
| "train_speed(iter/s)": 0.774361 | |
| }, | |
| { | |
| "epoch": 2.7931649610365223, | |
| "grad_norm": 0.018320417031645775, | |
| "learning_rate": 5.3644137988381846e-05, | |
| "loss": 0.002349804401397705, | |
| "memory(GiB)": 6.98, | |
| "step": 119000, | |
| "train_speed(iter/s)": 0.774374 | |
| }, | |
| { | |
| "epoch": 2.816636935499014, | |
| "grad_norm": 0.016526443883776665, | |
| "learning_rate": 5.290729397227828e-05, | |
| "loss": 0.0023311429023742678, | |
| "memory(GiB)": 6.98, | |
| "step": 120000, | |
| "train_speed(iter/s)": 0.77439 | |
| } | |
| ], | |
| "logging_steps": 1000, | |
| "max_steps": 213020, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 5, | |
| "save_steps": 10000, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": false | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 8.185900435797076e+19, | |
| "train_batch_size": 16, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |