{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 3.0, "eval_steps": 500, "global_step": 7788, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0003852080123266564, "grad_norm": 0.46284204721450806, "learning_rate": 3.205128205128205e-07, "loss": 2.371025800704956, "memory(GiB)": 21.78, "step": 1, "token_acc": 0.491588785046729, "train_speed(iter/s)": 0.013938 }, { "epoch": 0.001926040061633282, "grad_norm": 0.4700106978416443, "learning_rate": 1.6025641025641025e-06, "loss": 2.203892469406128, "memory(GiB)": 32.84, "step": 5, "token_acc": 0.5115570231140463, "train_speed(iter/s)": 0.062423 }, { "epoch": 0.003852080123266564, "grad_norm": 0.26454979181289673, "learning_rate": 3.205128205128205e-06, "loss": 2.249034881591797, "memory(GiB)": 32.84, "step": 10, "token_acc": 0.5221336266153423, "train_speed(iter/s)": 0.110437 }, { "epoch": 0.005778120184899846, "grad_norm": 0.3950284719467163, "learning_rate": 4.807692307692308e-06, "loss": 2.3276697158813477, "memory(GiB)": 32.84, "step": 15, "token_acc": 0.5241591662719091, "train_speed(iter/s)": 0.112702 }, { "epoch": 0.007704160246533128, "grad_norm": 0.5159429907798767, "learning_rate": 6.41025641025641e-06, "loss": 2.2817378997802735, "memory(GiB)": 32.84, "step": 20, "token_acc": 0.5184376516254245, "train_speed(iter/s)": 0.139372 }, { "epoch": 0.00963020030816641, "grad_norm": 0.5963405966758728, "learning_rate": 8.012820512820513e-06, "loss": 2.241648864746094, "memory(GiB)": 32.84, "step": 25, "token_acc": 0.5197465681098205, "train_speed(iter/s)": 0.136939 }, { "epoch": 0.011556240369799691, "grad_norm": 0.3511025607585907, "learning_rate": 9.615384615384616e-06, "loss": 2.2971473693847657, "memory(GiB)": 32.84, "step": 30, "token_acc": 0.5320556696326717, "train_speed(iter/s)": 0.155595 }, { "epoch": 0.013482280431432974, "grad_norm": 0.35379791259765625, "learning_rate": 1.1217948717948719e-05, "loss": 2.234834671020508, "memory(GiB)": 32.84, "step": 35, "token_acc": 0.5269398793426253, "train_speed(iter/s)": 0.17233 }, { "epoch": 0.015408320493066256, "grad_norm": 0.8552426695823669, "learning_rate": 1.282051282051282e-05, "loss": 2.2682783126831056, "memory(GiB)": 32.84, "step": 40, "token_acc": 0.5272496831432193, "train_speed(iter/s)": 0.164448 }, { "epoch": 0.017334360554699536, "grad_norm": 0.5381829142570496, "learning_rate": 1.4423076923076924e-05, "loss": 2.3280288696289064, "memory(GiB)": 44.17, "step": 45, "token_acc": 0.5237177943655189, "train_speed(iter/s)": 0.177578 }, { "epoch": 0.01926040061633282, "grad_norm": 0.8369658589363098, "learning_rate": 1.6025641025641026e-05, "loss": 2.3114912033081056, "memory(GiB)": 44.17, "step": 50, "token_acc": 0.5134586084306755, "train_speed(iter/s)": 0.168711 }, { "epoch": 0.0211864406779661, "grad_norm": 0.760637104511261, "learning_rate": 1.7628205128205127e-05, "loss": 2.27093563079834, "memory(GiB)": 44.17, "step": 55, "token_acc": 0.5235980011104941, "train_speed(iter/s)": 0.179294 }, { "epoch": 0.023112480739599383, "grad_norm": 0.6387038826942444, "learning_rate": 1.923076923076923e-05, "loss": 2.2536460876464846, "memory(GiB)": 44.17, "step": 60, "token_acc": 0.5071521456436932, "train_speed(iter/s)": 0.18911 }, { "epoch": 0.025038520801232665, "grad_norm": 0.5492486953735352, "learning_rate": 2.0833333333333333e-05, "loss": 2.266803741455078, "memory(GiB)": 44.17, "step": 65, "token_acc": 0.5215773809523809, "train_speed(iter/s)": 0.179833 }, { "epoch": 0.026964560862865947, "grad_norm": 1.2633668184280396, "learning_rate": 2.2435897435897437e-05, "loss": 2.301316833496094, "memory(GiB)": 44.17, "step": 70, "token_acc": 0.5262734584450403, "train_speed(iter/s)": 0.188206 }, { "epoch": 0.02889060092449923, "grad_norm": 0.683751106262207, "learning_rate": 2.4038461538461542e-05, "loss": 2.3863033294677733, "memory(GiB)": 44.17, "step": 75, "token_acc": 0.5030753459764223, "train_speed(iter/s)": 0.185858 }, { "epoch": 0.030816640986132512, "grad_norm": 0.773225724697113, "learning_rate": 2.564102564102564e-05, "loss": 2.2031593322753906, "memory(GiB)": 44.17, "step": 80, "token_acc": 0.5095634095634095, "train_speed(iter/s)": 0.193291 }, { "epoch": 0.032742681047765794, "grad_norm": 0.5375910997390747, "learning_rate": 2.7243589743589744e-05, "loss": 2.2097171783447265, "memory(GiB)": 44.17, "step": 85, "token_acc": 0.5262407979102351, "train_speed(iter/s)": 0.186851 }, { "epoch": 0.03466872110939907, "grad_norm": 1.0454059839248657, "learning_rate": 2.884615384615385e-05, "loss": 2.2334365844726562, "memory(GiB)": 55.69, "step": 90, "token_acc": 0.5370946246112839, "train_speed(iter/s)": 0.192933 }, { "epoch": 0.03659476117103236, "grad_norm": 0.6984673738479614, "learning_rate": 3.044871794871795e-05, "loss": 2.24798469543457, "memory(GiB)": 55.69, "step": 95, "token_acc": 0.532988675529296, "train_speed(iter/s)": 0.19931 }, { "epoch": 0.03852080123266564, "grad_norm": 0.7222554683685303, "learning_rate": 3.205128205128205e-05, "loss": 2.349885177612305, "memory(GiB)": 55.69, "step": 100, "token_acc": 0.517610710607621, "train_speed(iter/s)": 0.19213 }, { "epoch": 0.04044684129429892, "grad_norm": 0.7792360782623291, "learning_rate": 3.365384615384615e-05, "loss": 2.2670169830322267, "memory(GiB)": 55.69, "step": 105, "token_acc": 0.510149682181669, "train_speed(iter/s)": 0.197355 }, { "epoch": 0.0423728813559322, "grad_norm": 0.830783486366272, "learning_rate": 3.5256410256410254e-05, "loss": 2.2617393493652345, "memory(GiB)": 55.69, "step": 110, "token_acc": 0.5031599416626155, "train_speed(iter/s)": 0.19184 }, { "epoch": 0.04429892141756549, "grad_norm": 0.7352855205535889, "learning_rate": 3.685897435897436e-05, "loss": 2.1957550048828125, "memory(GiB)": 55.69, "step": 115, "token_acc": 0.5080334917402127, "train_speed(iter/s)": 0.195396 }, { "epoch": 0.046224961479198766, "grad_norm": 1.7222634553909302, "learning_rate": 3.846153846153846e-05, "loss": 2.218343734741211, "memory(GiB)": 55.69, "step": 120, "token_acc": 0.5067487098054784, "train_speed(iter/s)": 0.200238 }, { "epoch": 0.04815100154083205, "grad_norm": 0.6409298777580261, "learning_rate": 4.006410256410257e-05, "loss": 2.2596677780151366, "memory(GiB)": 67.24, "step": 125, "token_acc": 0.5263391864858857, "train_speed(iter/s)": 0.19248 }, { "epoch": 0.05007704160246533, "grad_norm": 0.7833207845687866, "learning_rate": 4.1666666666666665e-05, "loss": 2.2613948822021483, "memory(GiB)": 67.24, "step": 130, "token_acc": 0.5279594851234438, "train_speed(iter/s)": 0.197018 }, { "epoch": 0.052003081664098616, "grad_norm": 0.860501766204834, "learning_rate": 4.3269230769230766e-05, "loss": 2.2229248046875, "memory(GiB)": 67.24, "step": 135, "token_acc": 0.5466706302021404, "train_speed(iter/s)": 0.191379 }, { "epoch": 0.053929121725731895, "grad_norm": 0.8541775345802307, "learning_rate": 4.4871794871794874e-05, "loss": 2.3190549850463866, "memory(GiB)": 67.24, "step": 140, "token_acc": 0.5198630136986301, "train_speed(iter/s)": 0.195681 }, { "epoch": 0.05585516178736518, "grad_norm": 0.887022852897644, "learning_rate": 4.6474358974358976e-05, "loss": 2.2810138702392577, "memory(GiB)": 67.24, "step": 145, "token_acc": 0.5373987613149118, "train_speed(iter/s)": 0.193352 }, { "epoch": 0.05778120184899846, "grad_norm": 2.0370540618896484, "learning_rate": 4.8076923076923084e-05, "loss": 2.210652542114258, "memory(GiB)": 67.24, "step": 150, "token_acc": 0.5223017621145375, "train_speed(iter/s)": 0.195975 }, { "epoch": 0.05970724191063174, "grad_norm": 0.9455615878105164, "learning_rate": 4.967948717948718e-05, "loss": 2.20838623046875, "memory(GiB)": 67.24, "step": 155, "token_acc": 0.5513654096228868, "train_speed(iter/s)": 0.199862 }, { "epoch": 0.061633281972265024, "grad_norm": 0.6158351302146912, "learning_rate": 5.128205128205128e-05, "loss": 2.179709243774414, "memory(GiB)": 67.24, "step": 160, "token_acc": 0.5072685539403213, "train_speed(iter/s)": 0.196018 }, { "epoch": 0.0635593220338983, "grad_norm": 0.8856829404830933, "learning_rate": 5.288461538461539e-05, "loss": 2.2983753204345705, "memory(GiB)": 67.24, "step": 165, "token_acc": 0.49867181840135233, "train_speed(iter/s)": 0.199352 }, { "epoch": 0.06548536209553159, "grad_norm": 0.7724166512489319, "learning_rate": 5.448717948717949e-05, "loss": 2.2879966735839843, "memory(GiB)": 67.24, "step": 170, "token_acc": 0.5076196608714316, "train_speed(iter/s)": 0.197413 }, { "epoch": 0.06741140215716487, "grad_norm": 4.146669864654541, "learning_rate": 5.608974358974359e-05, "loss": 2.3056015014648437, "memory(GiB)": 67.24, "step": 175, "token_acc": 0.5283564814814815, "train_speed(iter/s)": 0.198077 }, { "epoch": 0.06933744221879815, "grad_norm": 0.8423267006874084, "learning_rate": 5.76923076923077e-05, "loss": 2.243014907836914, "memory(GiB)": 67.24, "step": 180, "token_acc": 0.524451939291737, "train_speed(iter/s)": 0.201027 }, { "epoch": 0.07126348228043143, "grad_norm": 5.1034650802612305, "learning_rate": 5.929487179487179e-05, "loss": 2.196868133544922, "memory(GiB)": 79.85, "step": 185, "token_acc": 0.5295799428194414, "train_speed(iter/s)": 0.197658 }, { "epoch": 0.07318952234206472, "grad_norm": 0.7008342146873474, "learning_rate": 6.08974358974359e-05, "loss": 2.2257001876831053, "memory(GiB)": 79.85, "step": 190, "token_acc": 0.5335993280134397, "train_speed(iter/s)": 0.199699 }, { "epoch": 0.075115562403698, "grad_norm": 2.709761381149292, "learning_rate": 6.25e-05, "loss": 2.246750259399414, "memory(GiB)": 79.85, "step": 195, "token_acc": 0.5247820100963745, "train_speed(iter/s)": 0.198348 }, { "epoch": 0.07704160246533127, "grad_norm": 0.6688154935836792, "learning_rate": 6.41025641025641e-05, "loss": 2.338885498046875, "memory(GiB)": 79.85, "step": 200, "token_acc": 0.5158970476911431, "train_speed(iter/s)": 0.201319 }, { "epoch": 0.07896764252696456, "grad_norm": 0.7070778012275696, "learning_rate": 6.57051282051282e-05, "loss": 2.2234432220458986, "memory(GiB)": 79.85, "step": 205, "token_acc": 0.5176201372997712, "train_speed(iter/s)": 0.199844 }, { "epoch": 0.08089368258859785, "grad_norm": 0.7464547753334045, "learning_rate": 6.73076923076923e-05, "loss": 2.297138977050781, "memory(GiB)": 79.85, "step": 210, "token_acc": 0.5106699751861042, "train_speed(iter/s)": 0.201068 }, { "epoch": 0.08281972265023113, "grad_norm": 0.6286822557449341, "learning_rate": 6.891025641025642e-05, "loss": 2.229446601867676, "memory(GiB)": 79.85, "step": 215, "token_acc": 0.5232629637220741, "train_speed(iter/s)": 0.203549 }, { "epoch": 0.0847457627118644, "grad_norm": 0.6389124989509583, "learning_rate": 7.051282051282051e-05, "loss": 2.2447444915771486, "memory(GiB)": 79.85, "step": 220, "token_acc": 0.5157593123209169, "train_speed(iter/s)": 0.200456 }, { "epoch": 0.08667180277349769, "grad_norm": 1.6869045495986938, "learning_rate": 7.211538461538461e-05, "loss": 2.2634090423583983, "memory(GiB)": 79.85, "step": 225, "token_acc": 0.5259638080251771, "train_speed(iter/s)": 0.203142 }, { "epoch": 0.08859784283513097, "grad_norm": 1.095736026763916, "learning_rate": 7.371794871794872e-05, "loss": 2.235662078857422, "memory(GiB)": 79.85, "step": 230, "token_acc": 0.5303529411764706, "train_speed(iter/s)": 0.201621 }, { "epoch": 0.09052388289676425, "grad_norm": 1.024219036102295, "learning_rate": 7.532051282051282e-05, "loss": 2.2247970581054686, "memory(GiB)": 79.85, "step": 235, "token_acc": 0.5455431076473454, "train_speed(iter/s)": 0.204201 }, { "epoch": 0.09244992295839753, "grad_norm": 1.3048988580703735, "learning_rate": 7.692307692307693e-05, "loss": 2.2020389556884767, "memory(GiB)": 79.85, "step": 240, "token_acc": 0.5023310023310024, "train_speed(iter/s)": 0.206181 }, { "epoch": 0.09437596302003082, "grad_norm": 0.9033989906311035, "learning_rate": 7.852564102564103e-05, "loss": 2.202723503112793, "memory(GiB)": 79.85, "step": 245, "token_acc": 0.5280989513310029, "train_speed(iter/s)": 0.202688 }, { "epoch": 0.0963020030816641, "grad_norm": 0.6796330809593201, "learning_rate": 8.012820512820514e-05, "loss": 2.233873748779297, "memory(GiB)": 79.85, "step": 250, "token_acc": 0.5017253278122843, "train_speed(iter/s)": 0.204961 }, { "epoch": 0.09822804314329737, "grad_norm": 1.8503941297531128, "learning_rate": 8.173076923076923e-05, "loss": 2.201646423339844, "memory(GiB)": 79.85, "step": 255, "token_acc": 0.5372055674518201, "train_speed(iter/s)": 0.201749 }, { "epoch": 0.10015408320493066, "grad_norm": 1.759498119354248, "learning_rate": 8.333333333333333e-05, "loss": 2.210206985473633, "memory(GiB)": 79.85, "step": 260, "token_acc": 0.5258378378378379, "train_speed(iter/s)": 0.204008 }, { "epoch": 0.10208012326656395, "grad_norm": 1.558002233505249, "learning_rate": 8.493589743589745e-05, "loss": 2.3287845611572267, "memory(GiB)": 79.85, "step": 265, "token_acc": 0.5165515598952132, "train_speed(iter/s)": 0.203423 }, { "epoch": 0.10400616332819723, "grad_norm": 2.7055013179779053, "learning_rate": 8.653846153846153e-05, "loss": 2.2146034240722656, "memory(GiB)": 79.85, "step": 270, "token_acc": 0.5245828698553949, "train_speed(iter/s)": 0.202798 }, { "epoch": 0.1059322033898305, "grad_norm": 0.9891285300254822, "learning_rate": 8.814102564102565e-05, "loss": 2.188070297241211, "memory(GiB)": 79.85, "step": 275, "token_acc": 0.5225942402247717, "train_speed(iter/s)": 0.204975 }, { "epoch": 0.10785824345146379, "grad_norm": 0.9874178171157837, "learning_rate": 8.974358974358975e-05, "loss": 2.1638275146484376, "memory(GiB)": 79.85, "step": 280, "token_acc": 0.5529093369418132, "train_speed(iter/s)": 0.202735 }, { "epoch": 0.10978428351309708, "grad_norm": 0.7807070016860962, "learning_rate": 9.134615384615384e-05, "loss": 2.2683109283447265, "memory(GiB)": 79.85, "step": 285, "token_acc": 0.5302190551596727, "train_speed(iter/s)": 0.204627 }, { "epoch": 0.11171032357473036, "grad_norm": 0.6836365461349487, "learning_rate": 9.294871794871795e-05, "loss": 2.2368232727050783, "memory(GiB)": 79.85, "step": 290, "token_acc": 0.5263838592860838, "train_speed(iter/s)": 0.202544 }, { "epoch": 0.11363636363636363, "grad_norm": 0.9923797845840454, "learning_rate": 9.455128205128205e-05, "loss": 2.152564811706543, "memory(GiB)": 79.85, "step": 295, "token_acc": 0.5188876013904983, "train_speed(iter/s)": 0.204553 }, { "epoch": 0.11556240369799692, "grad_norm": 0.7536174654960632, "learning_rate": 9.615384615384617e-05, "loss": 2.157516860961914, "memory(GiB)": 79.85, "step": 300, "token_acc": 0.5454342487162313, "train_speed(iter/s)": 0.20622 }, { "epoch": 0.1174884437596302, "grad_norm": 7.1967549324035645, "learning_rate": 9.775641025641025e-05, "loss": 2.0982955932617187, "memory(GiB)": 79.85, "step": 305, "token_acc": 0.5410308090987619, "train_speed(iter/s)": 0.203884 }, { "epoch": 0.11941448382126348, "grad_norm": 0.5281727910041809, "learning_rate": 9.935897435897436e-05, "loss": 2.2395370483398436, "memory(GiB)": 79.85, "step": 310, "token_acc": 0.5202040816326531, "train_speed(iter/s)": 0.20575 }, { "epoch": 0.12134052388289676, "grad_norm": 1.5248783826828003, "learning_rate": 0.00010096153846153847, "loss": 2.281228256225586, "memory(GiB)": 79.85, "step": 315, "token_acc": 0.5254635675110995, "train_speed(iter/s)": 0.203526 }, { "epoch": 0.12326656394453005, "grad_norm": 0.8702052235603333, "learning_rate": 0.00010256410256410256, "loss": 2.172785758972168, "memory(GiB)": 79.85, "step": 320, "token_acc": 0.5519110096976612, "train_speed(iter/s)": 0.205369 }, { "epoch": 0.12519260400616333, "grad_norm": 2.1862897872924805, "learning_rate": 0.00010416666666666667, "loss": 2.23248291015625, "memory(GiB)": 79.85, "step": 325, "token_acc": 0.5359653866955111, "train_speed(iter/s)": 0.206137 }, { "epoch": 0.1271186440677966, "grad_norm": 0.6504359245300293, "learning_rate": 0.00010576923076923077, "loss": 2.1315258026123045, "memory(GiB)": 79.85, "step": 330, "token_acc": 0.5330889092575619, "train_speed(iter/s)": 0.207189 }, { "epoch": 0.1290446841294299, "grad_norm": 1.1709946393966675, "learning_rate": 0.00010737179487179486, "loss": 2.1950706481933593, "memory(GiB)": 79.85, "step": 335, "token_acc": 0.5084640792733278, "train_speed(iter/s)": 0.206613 }, { "epoch": 0.13097072419106318, "grad_norm": 0.46994733810424805, "learning_rate": 0.00010897435897435898, "loss": 2.2042753219604494, "memory(GiB)": 79.85, "step": 340, "token_acc": 0.5417880349540668, "train_speed(iter/s)": 0.206589 }, { "epoch": 0.13289676425269645, "grad_norm": 1.0993995666503906, "learning_rate": 0.00011057692307692308, "loss": 2.2882259368896483, "memory(GiB)": 79.85, "step": 345, "token_acc": 0.5274168685311605, "train_speed(iter/s)": 0.206101 }, { "epoch": 0.13482280431432975, "grad_norm": 0.5390233397483826, "learning_rate": 0.00011217948717948718, "loss": 2.251546859741211, "memory(GiB)": 79.85, "step": 350, "token_acc": 0.548828125, "train_speed(iter/s)": 0.205565 }, { "epoch": 0.13674884437596302, "grad_norm": 0.5272419452667236, "learning_rate": 0.00011378205128205128, "loss": 2.2364831924438477, "memory(GiB)": 79.85, "step": 355, "token_acc": 0.5096008084891359, "train_speed(iter/s)": 0.207208 }, { "epoch": 0.1386748844375963, "grad_norm": 0.5430485010147095, "learning_rate": 0.0001153846153846154, "loss": 2.2397247314453126, "memory(GiB)": 79.85, "step": 360, "token_acc": 0.5234200743494424, "train_speed(iter/s)": 0.208354 }, { "epoch": 0.1406009244992296, "grad_norm": 0.7808792591094971, "learning_rate": 0.0001169871794871795, "loss": 2.282427978515625, "memory(GiB)": 79.85, "step": 365, "token_acc": 0.5037704231252619, "train_speed(iter/s)": 0.206541 }, { "epoch": 0.14252696456086286, "grad_norm": 0.4293100833892822, "learning_rate": 0.00011858974358974358, "loss": 2.214054489135742, "memory(GiB)": 79.85, "step": 370, "token_acc": 0.5278355278355278, "train_speed(iter/s)": 0.207825 }, { "epoch": 0.14445300462249616, "grad_norm": 0.9003456234931946, "learning_rate": 0.0001201923076923077, "loss": 2.1916942596435547, "memory(GiB)": 79.85, "step": 375, "token_acc": 0.5359328950351394, "train_speed(iter/s)": 0.204903 }, { "epoch": 0.14637904468412943, "grad_norm": 0.7104191184043884, "learning_rate": 0.0001217948717948718, "loss": 2.247498321533203, "memory(GiB)": 79.85, "step": 380, "token_acc": 0.5167552576843079, "train_speed(iter/s)": 0.206413 }, { "epoch": 0.1483050847457627, "grad_norm": 0.5338280200958252, "learning_rate": 0.0001233974358974359, "loss": 2.1627017974853517, "memory(GiB)": 79.85, "step": 385, "token_acc": 0.53835585069842, "train_speed(iter/s)": 0.206429 }, { "epoch": 0.150231124807396, "grad_norm": 1.5957274436950684, "learning_rate": 0.000125, "loss": 2.2079803466796877, "memory(GiB)": 79.85, "step": 390, "token_acc": 0.531615925058548, "train_speed(iter/s)": 0.20449 }, { "epoch": 0.15215716486902928, "grad_norm": 0.7144642472267151, "learning_rate": 0.00012499985911623197, "loss": 2.2493335723876955, "memory(GiB)": 79.85, "step": 395, "token_acc": 0.5375455650060753, "train_speed(iter/s)": 0.20601 }, { "epoch": 0.15408320493066255, "grad_norm": 0.6453521847724915, "learning_rate": 0.000124999436465563, "loss": 2.182133102416992, "memory(GiB)": 79.85, "step": 400, "token_acc": 0.5343928482741495, "train_speed(iter/s)": 0.203363 }, { "epoch": 0.15600924499229585, "grad_norm": 0.6827189326286316, "learning_rate": 0.00012499873204989856, "loss": 2.216513824462891, "memory(GiB)": 79.85, "step": 405, "token_acc": 0.5300488426417499, "train_speed(iter/s)": 0.204854 }, { "epoch": 0.15793528505392912, "grad_norm": 0.6293906569480896, "learning_rate": 0.0001249977458724143, "loss": 2.1550098419189454, "memory(GiB)": 79.85, "step": 410, "token_acc": 0.5417820867959372, "train_speed(iter/s)": 0.20197 }, { "epoch": 0.1598613251155624, "grad_norm": 0.5983798503875732, "learning_rate": 0.00012499647793755622, "loss": 2.196070098876953, "memory(GiB)": 79.85, "step": 415, "token_acc": 0.526906878802059, "train_speed(iter/s)": 0.203399 }, { "epoch": 0.1617873651771957, "grad_norm": 5.2007737159729, "learning_rate": 0.00012499492825104053, "loss": 2.2286691665649414, "memory(GiB)": 79.85, "step": 420, "token_acc": 0.5239111870196413, "train_speed(iter/s)": 0.204811 }, { "epoch": 0.16371340523882896, "grad_norm": 0.4801613986492157, "learning_rate": 0.00012499309681985362, "loss": 2.228078842163086, "memory(GiB)": 79.85, "step": 425, "token_acc": 0.520584652862363, "train_speed(iter/s)": 0.203128 }, { "epoch": 0.16563944530046226, "grad_norm": 1.7402924299240112, "learning_rate": 0.00012499098365225213, "loss": 2.1930723190307617, "memory(GiB)": 79.85, "step": 430, "token_acc": 0.537429568017172, "train_speed(iter/s)": 0.20453 }, { "epoch": 0.16756548536209553, "grad_norm": 0.6129881143569946, "learning_rate": 0.0001249885887577628, "loss": 2.139969825744629, "memory(GiB)": 79.85, "step": 435, "token_acc": 0.5450490633363069, "train_speed(iter/s)": 0.201099 }, { "epoch": 0.1694915254237288, "grad_norm": 0.6262999176979065, "learning_rate": 0.00012498591214718248, "loss": 2.212021255493164, "memory(GiB)": 79.85, "step": 440, "token_acc": 0.5390710983931323, "train_speed(iter/s)": 0.202387 }, { "epoch": 0.1714175654853621, "grad_norm": 0.9113600254058838, "learning_rate": 0.00012498295383257807, "loss": 2.0877065658569336, "memory(GiB)": 79.85, "step": 445, "token_acc": 0.536497175141243, "train_speed(iter/s)": 0.203434 }, { "epoch": 0.17334360554699538, "grad_norm": 0.47799283266067505, "learning_rate": 0.0001249797138272865, "loss": 2.2158781051635743, "memory(GiB)": 79.85, "step": 450, "token_acc": 0.5326836225338721, "train_speed(iter/s)": 0.202794 }, { "epoch": 0.17526964560862865, "grad_norm": 0.547575831413269, "learning_rate": 0.00012497619214591463, "loss": 2.2185787200927733, "memory(GiB)": 79.85, "step": 455, "token_acc": 0.5258584145824502, "train_speed(iter/s)": 0.204115 }, { "epoch": 0.17719568567026195, "grad_norm": 2.353126287460327, "learning_rate": 0.0001249723888043392, "loss": 2.216251182556152, "memory(GiB)": 79.85, "step": 460, "token_acc": 0.533461620697028, "train_speed(iter/s)": 0.202909 }, { "epoch": 0.17912172573189522, "grad_norm": 0.7597701549530029, "learning_rate": 0.00012496830381970668, "loss": 2.152217483520508, "memory(GiB)": 79.85, "step": 465, "token_acc": 0.5328542094455853, "train_speed(iter/s)": 0.204216 }, { "epoch": 0.1810477657935285, "grad_norm": 0.7759498357772827, "learning_rate": 0.00012496393721043338, "loss": 2.131561279296875, "memory(GiB)": 79.85, "step": 470, "token_acc": 0.5186906445746615, "train_speed(iter/s)": 0.202024 }, { "epoch": 0.1829738058551618, "grad_norm": 1.137546420097351, "learning_rate": 0.0001249592889962052, "loss": 2.1353374481201173, "memory(GiB)": 79.85, "step": 475, "token_acc": 0.5248306997742663, "train_speed(iter/s)": 0.203244 }, { "epoch": 0.18489984591679506, "grad_norm": 1.0947918891906738, "learning_rate": 0.00012495435919797758, "loss": 2.192966270446777, "memory(GiB)": 79.85, "step": 480, "token_acc": 0.5140420220511753, "train_speed(iter/s)": 0.20449 }, { "epoch": 0.18682588597842836, "grad_norm": 1.1944098472595215, "learning_rate": 0.0001249491478379754, "loss": 2.1541446685791015, "memory(GiB)": 79.85, "step": 485, "token_acc": 0.5353901996370236, "train_speed(iter/s)": 0.203804 }, { "epoch": 0.18875192604006163, "grad_norm": 1.2369686365127563, "learning_rate": 0.000124943654939693, "loss": 2.1915687561035155, "memory(GiB)": 79.85, "step": 490, "token_acc": 0.5267611592976518, "train_speed(iter/s)": 0.205019 }, { "epoch": 0.1906779661016949, "grad_norm": 0.7297829985618591, "learning_rate": 0.00012493788052789386, "loss": 2.184051513671875, "memory(GiB)": 79.85, "step": 495, "token_acc": 0.5402985074626866, "train_speed(iter/s)": 0.203977 }, { "epoch": 0.1926040061633282, "grad_norm": 1.6911697387695312, "learning_rate": 0.00012493182462861068, "loss": 2.233272171020508, "memory(GiB)": 79.85, "step": 500, "token_acc": 0.5366824173091271, "train_speed(iter/s)": 0.205157 }, { "epoch": 0.19453004622496148, "grad_norm": 0.7485533952713013, "learning_rate": 0.0001249254872691451, "loss": 2.175897979736328, "memory(GiB)": 79.85, "step": 505, "token_acc": 0.5402777777777777, "train_speed(iter/s)": 0.204111 }, { "epoch": 0.19645608628659475, "grad_norm": 0.48097991943359375, "learning_rate": 0.00012491886847806777, "loss": 2.190257453918457, "memory(GiB)": 79.85, "step": 510, "token_acc": 0.5596064814814815, "train_speed(iter/s)": 0.205268 }, { "epoch": 0.19838212634822805, "grad_norm": 0.8839398622512817, "learning_rate": 0.00012491196828521802, "loss": 2.1894506454467773, "memory(GiB)": 79.85, "step": 515, "token_acc": 0.5173086299366163, "train_speed(iter/s)": 0.206445 }, { "epoch": 0.20030816640986132, "grad_norm": 4.143980503082275, "learning_rate": 0.00012490478672170388, "loss": 2.1409215927124023, "memory(GiB)": 79.85, "step": 520, "token_acc": 0.527306967984934, "train_speed(iter/s)": 0.204274 }, { "epoch": 0.20223420647149462, "grad_norm": 1.3725707530975342, "learning_rate": 0.00012489732381990184, "loss": 2.1883153915405273, "memory(GiB)": 79.85, "step": 525, "token_acc": 0.5199283475145544, "train_speed(iter/s)": 0.205428 }, { "epoch": 0.2041602465331279, "grad_norm": 1.092573642730713, "learning_rate": 0.00012488957961345678, "loss": 2.2205310821533204, "memory(GiB)": 79.85, "step": 530, "token_acc": 0.5519459633322612, "train_speed(iter/s)": 0.204143 }, { "epoch": 0.20608628659476116, "grad_norm": 0.8245734572410583, "learning_rate": 0.00012488155413728171, "loss": 2.179944610595703, "memory(GiB)": 79.85, "step": 535, "token_acc": 0.5104846225535881, "train_speed(iter/s)": 0.205223 }, { "epoch": 0.20801232665639446, "grad_norm": 1.2626621723175049, "learning_rate": 0.00012487324742755778, "loss": 2.1643230438232424, "memory(GiB)": 79.85, "step": 540, "token_acc": 0.5341967734605771, "train_speed(iter/s)": 0.206319 }, { "epoch": 0.20993836671802774, "grad_norm": 0.750433623790741, "learning_rate": 0.00012486465952173394, "loss": 2.1548141479492187, "memory(GiB)": 79.85, "step": 545, "token_acc": 0.5284785435630689, "train_speed(iter/s)": 0.205458 }, { "epoch": 0.211864406779661, "grad_norm": 1.3458155393600464, "learning_rate": 0.0001248557904585269, "loss": 2.1688873291015627, "memory(GiB)": 79.85, "step": 550, "token_acc": 0.5374526377149519, "train_speed(iter/s)": 0.206561 }, { "epoch": 0.2137904468412943, "grad_norm": 1.7017052173614502, "learning_rate": 0.00012484664027792081, "loss": 2.1563148498535156, "memory(GiB)": 79.85, "step": 555, "token_acc": 0.5385852090032154, "train_speed(iter/s)": 0.205565 }, { "epoch": 0.21571648690292758, "grad_norm": 0.8666205406188965, "learning_rate": 0.00012483720902116736, "loss": 2.1540388107299804, "memory(GiB)": 79.85, "step": 560, "token_acc": 0.5175918686473807, "train_speed(iter/s)": 0.206598 }, { "epoch": 0.21764252696456085, "grad_norm": 1.5656309127807617, "learning_rate": 0.0001248274967307852, "loss": 2.1744287490844725, "memory(GiB)": 79.85, "step": 565, "token_acc": 0.5209335899903753, "train_speed(iter/s)": 0.205796 }, { "epoch": 0.21956856702619415, "grad_norm": 0.8936501145362854, "learning_rate": 0.00012481750345056015, "loss": 2.231153106689453, "memory(GiB)": 79.85, "step": 570, "token_acc": 0.5342115611482501, "train_speed(iter/s)": 0.206852 }, { "epoch": 0.22149460708782742, "grad_norm": 1.291582703590393, "learning_rate": 0.0001248072292255447, "loss": 2.195969009399414, "memory(GiB)": 79.85, "step": 575, "token_acc": 0.5311691366737238, "train_speed(iter/s)": 0.207793 }, { "epoch": 0.22342064714946072, "grad_norm": 0.6491249799728394, "learning_rate": 0.00012479667410205785, "loss": 2.173289489746094, "memory(GiB)": 79.85, "step": 580, "token_acc": 0.53319357092942, "train_speed(iter/s)": 0.206575 }, { "epoch": 0.225346687211094, "grad_norm": 2.2959673404693604, "learning_rate": 0.00012478583812768518, "loss": 2.1829410552978517, "memory(GiB)": 79.85, "step": 585, "token_acc": 0.5279026712509918, "train_speed(iter/s)": 0.207609 }, { "epoch": 0.22727272727272727, "grad_norm": 0.6624155044555664, "learning_rate": 0.00012477472135127824, "loss": 2.1412792205810547, "memory(GiB)": 79.85, "step": 590, "token_acc": 0.5319976076555024, "train_speed(iter/s)": 0.206578 }, { "epoch": 0.22919876733436056, "grad_norm": 2.478637218475342, "learning_rate": 0.0001247633238229546, "loss": 2.15417537689209, "memory(GiB)": 79.85, "step": 595, "token_acc": 0.5192682926829268, "train_speed(iter/s)": 0.207599 }, { "epoch": 0.23112480739599384, "grad_norm": 1.6136051416397095, "learning_rate": 0.00012475164559409748, "loss": 2.1549308776855467, "memory(GiB)": 79.85, "step": 600, "token_acc": 0.5380829622685728, "train_speed(iter/s)": 0.207515 }, { "epoch": 0.2330508474576271, "grad_norm": 1.033865213394165, "learning_rate": 0.00012473968671735565, "loss": 2.066006088256836, "memory(GiB)": 79.85, "step": 605, "token_acc": 0.5451037144235408, "train_speed(iter/s)": 0.207361 }, { "epoch": 0.2349768875192604, "grad_norm": 1.171897053718567, "learning_rate": 0.00012472744724664305, "loss": 2.152410125732422, "memory(GiB)": 79.85, "step": 610, "token_acc": 0.5231010180109632, "train_speed(iter/s)": 0.208312 }, { "epoch": 0.23690292758089368, "grad_norm": 2.0283079147338867, "learning_rate": 0.0001247149272371387, "loss": 2.111717414855957, "memory(GiB)": 79.85, "step": 615, "token_acc": 0.5375532961626763, "train_speed(iter/s)": 0.206514 }, { "epoch": 0.23882896764252695, "grad_norm": 1.5509942770004272, "learning_rate": 0.00012470212674528628, "loss": 2.147776222229004, "memory(GiB)": 79.85, "step": 620, "token_acc": 0.5202908749706779, "train_speed(iter/s)": 0.207458 }, { "epoch": 0.24075500770416025, "grad_norm": 0.6883136034011841, "learning_rate": 0.00012468904582879398, "loss": 2.1620344161987304, "memory(GiB)": 79.85, "step": 625, "token_acc": 0.53108228980322, "train_speed(iter/s)": 0.206865 }, { "epoch": 0.24268104776579352, "grad_norm": 0.9905964732170105, "learning_rate": 0.00012467568454663426, "loss": 2.136301040649414, "memory(GiB)": 79.85, "step": 630, "token_acc": 0.5512849670229703, "train_speed(iter/s)": 0.206729 }, { "epoch": 0.24460708782742682, "grad_norm": 1.9961880445480347, "learning_rate": 0.00012466204295904354, "loss": 2.089532470703125, "memory(GiB)": 79.85, "step": 635, "token_acc": 0.5415720127214902, "train_speed(iter/s)": 0.206941 }, { "epoch": 0.2465331278890601, "grad_norm": 0.7378602027893066, "learning_rate": 0.0001246481211275219, "loss": 2.1900714874267577, "memory(GiB)": 79.85, "step": 640, "token_acc": 0.519208381839348, "train_speed(iter/s)": 0.206255 }, { "epoch": 0.24845916795069337, "grad_norm": 0.7011188268661499, "learning_rate": 0.0001246339191148329, "loss": 2.1525733947753904, "memory(GiB)": 79.85, "step": 645, "token_acc": 0.539046010975095, "train_speed(iter/s)": 0.207188 }, { "epoch": 0.25038520801232667, "grad_norm": 1.2385390996932983, "learning_rate": 0.0001246194369850032, "loss": 2.1426889419555666, "memory(GiB)": 79.85, "step": 650, "token_acc": 0.5399509803921568, "train_speed(iter/s)": 0.20529 }, { "epoch": 0.25231124807395994, "grad_norm": 0.9886940717697144, "learning_rate": 0.00012460467480332222, "loss": 2.145462989807129, "memory(GiB)": 79.85, "step": 655, "token_acc": 0.5274824700294051, "train_speed(iter/s)": 0.206216 }, { "epoch": 0.2542372881355932, "grad_norm": 0.756267786026001, "learning_rate": 0.0001245896326363421, "loss": 2.103159713745117, "memory(GiB)": 79.85, "step": 660, "token_acc": 0.5443285528031291, "train_speed(iter/s)": 0.207107 }, { "epoch": 0.2561633281972265, "grad_norm": 0.7367931604385376, "learning_rate": 0.00012457431055187715, "loss": 2.1234664916992188, "memory(GiB)": 79.85, "step": 665, "token_acc": 0.5417185554171855, "train_speed(iter/s)": 0.206003 }, { "epoch": 0.2580893682588598, "grad_norm": 0.8494862914085388, "learning_rate": 0.0001245587086190036, "loss": 2.1641502380371094, "memory(GiB)": 79.85, "step": 670, "token_acc": 0.5548288641813822, "train_speed(iter/s)": 0.206884 }, { "epoch": 0.2600154083204931, "grad_norm": 0.9068291187286377, "learning_rate": 0.0001245428269080593, "loss": 2.0993995666503906, "memory(GiB)": 79.85, "step": 675, "token_acc": 0.5394105551747772, "train_speed(iter/s)": 0.205466 }, { "epoch": 0.26194144838212635, "grad_norm": 1.0292894840240479, "learning_rate": 0.00012452666549064354, "loss": 2.2421758651733397, "memory(GiB)": 79.85, "step": 680, "token_acc": 0.5255948089401586, "train_speed(iter/s)": 0.206359 }, { "epoch": 0.2638674884437596, "grad_norm": 0.7002666592597961, "learning_rate": 0.00012451022443961648, "loss": 2.2322803497314454, "memory(GiB)": 79.85, "step": 685, "token_acc": 0.5309630327289852, "train_speed(iter/s)": 0.207236 }, { "epoch": 0.2657935285053929, "grad_norm": 0.7977465391159058, "learning_rate": 0.000124493503829099, "loss": 2.1305238723754885, "memory(GiB)": 79.85, "step": 690, "token_acc": 0.5295850724281856, "train_speed(iter/s)": 0.205618 }, { "epoch": 0.26771956856702617, "grad_norm": 0.776294469833374, "learning_rate": 0.0001244765037344723, "loss": 2.162790298461914, "memory(GiB)": 79.85, "step": 695, "token_acc": 0.5114279248698801, "train_speed(iter/s)": 0.206468 }, { "epoch": 0.2696456086286595, "grad_norm": 0.8615128993988037, "learning_rate": 0.0001244592242323776, "loss": 2.1106941223144533, "memory(GiB)": 79.85, "step": 700, "token_acc": 0.5509896729776248, "train_speed(iter/s)": 0.205448 }, { "epoch": 0.27157164869029277, "grad_norm": 0.6523112654685974, "learning_rate": 0.00012444166540071568, "loss": 2.152960205078125, "memory(GiB)": 79.85, "step": 705, "token_acc": 0.5195206803247004, "train_speed(iter/s)": 0.206286 }, { "epoch": 0.27349768875192604, "grad_norm": 1.0108753442764282, "learning_rate": 0.00012442382731864675, "loss": 2.178171157836914, "memory(GiB)": 79.85, "step": 710, "token_acc": 0.5352564102564102, "train_speed(iter/s)": 0.205308 }, { "epoch": 0.2754237288135593, "grad_norm": 1.3268048763275146, "learning_rate": 0.00012440571006658985, "loss": 2.136724853515625, "memory(GiB)": 79.85, "step": 715, "token_acc": 0.5580524344569289, "train_speed(iter/s)": 0.206154 }, { "epoch": 0.2773497688751926, "grad_norm": 1.2465232610702515, "learning_rate": 0.00012438731372622265, "loss": 2.1769336700439452, "memory(GiB)": 79.85, "step": 720, "token_acc": 0.5532096395820004, "train_speed(iter/s)": 0.206973 }, { "epoch": 0.2792758089368259, "grad_norm": 1.9088857173919678, "learning_rate": 0.00012436863838048102, "loss": 2.1059314727783205, "memory(GiB)": 79.85, "step": 725, "token_acc": 0.5443349753694581, "train_speed(iter/s)": 0.206383 }, { "epoch": 0.2812018489984592, "grad_norm": 1.2093032598495483, "learning_rate": 0.00012434968411355863, "loss": 2.1533790588378907, "memory(GiB)": 79.85, "step": 730, "token_acc": 0.5251533742331288, "train_speed(iter/s)": 0.207214 }, { "epoch": 0.28312788906009245, "grad_norm": 1.328275203704834, "learning_rate": 0.00012433045101090665, "loss": 2.1687450408935547, "memory(GiB)": 79.85, "step": 735, "token_acc": 0.5401069518716578, "train_speed(iter/s)": 0.206175 }, { "epoch": 0.2850539291217257, "grad_norm": 0.8366193175315857, "learning_rate": 0.00012431093915923333, "loss": 2.1700584411621096, "memory(GiB)": 79.85, "step": 740, "token_acc": 0.5420981539846916, "train_speed(iter/s)": 0.206949 }, { "epoch": 0.286979969183359, "grad_norm": 0.5917710661888123, "learning_rate": 0.0001242911486465035, "loss": 2.1334373474121096, "memory(GiB)": 79.85, "step": 745, "token_acc": 0.5226154206702601, "train_speed(iter/s)": 0.207764 }, { "epoch": 0.2889060092449923, "grad_norm": 0.5300167202949524, "learning_rate": 0.00012427107956193846, "loss": 2.157124900817871, "memory(GiB)": 79.85, "step": 750, "token_acc": 0.537828947368421, "train_speed(iter/s)": 0.206411 }, { "epoch": 0.2908320493066256, "grad_norm": 2.3136775493621826, "learning_rate": 0.00012425073199601514, "loss": 2.154123306274414, "memory(GiB)": 79.85, "step": 755, "token_acc": 0.5495611770779556, "train_speed(iter/s)": 0.207199 }, { "epoch": 0.29275808936825887, "grad_norm": 0.5608005523681641, "learning_rate": 0.00012423010604046617, "loss": 2.128403091430664, "memory(GiB)": 79.85, "step": 760, "token_acc": 0.5565662308129619, "train_speed(iter/s)": 0.206742 }, { "epoch": 0.29468412942989214, "grad_norm": 1.7282224893569946, "learning_rate": 0.0001242092017882791, "loss": 2.0894710540771486, "memory(GiB)": 79.85, "step": 765, "token_acc": 0.5356890459363958, "train_speed(iter/s)": 0.206811 }, { "epoch": 0.2966101694915254, "grad_norm": 0.66438889503479, "learning_rate": 0.00012418801933369622, "loss": 2.145112991333008, "memory(GiB)": 79.85, "step": 770, "token_acc": 0.5387755102040817, "train_speed(iter/s)": 0.206595 }, { "epoch": 0.2985362095531587, "grad_norm": 1.0348610877990723, "learning_rate": 0.0001241665587722139, "loss": 2.110944366455078, "memory(GiB)": 79.85, "step": 775, "token_acc": 0.5398929983717143, "train_speed(iter/s)": 0.20699 }, { "epoch": 0.300462249614792, "grad_norm": 0.7911678552627563, "learning_rate": 0.00012414482020058244, "loss": 2.106073760986328, "memory(GiB)": 79.85, "step": 780, "token_acc": 0.5268990995151235, "train_speed(iter/s)": 0.207758 }, { "epoch": 0.3023882896764253, "grad_norm": 0.6585643887519836, "learning_rate": 0.00012412280371680538, "loss": 2.180895233154297, "memory(GiB)": 79.85, "step": 785, "token_acc": 0.5228360156589822, "train_speed(iter/s)": 0.20744 }, { "epoch": 0.30431432973805855, "grad_norm": 1.980449914932251, "learning_rate": 0.0001241005094201392, "loss": 2.1610347747802736, "memory(GiB)": 79.85, "step": 790, "token_acc": 0.532167530224525, "train_speed(iter/s)": 0.207829 }, { "epoch": 0.3062403697996918, "grad_norm": 1.8646785020828247, "learning_rate": 0.00012407793741109287, "loss": 2.123297691345215, "memory(GiB)": 79.85, "step": 795, "token_acc": 0.523725834797891, "train_speed(iter/s)": 0.20703 }, { "epoch": 0.3081664098613251, "grad_norm": 1.4203855991363525, "learning_rate": 0.00012405508779142734, "loss": 2.138237190246582, "memory(GiB)": 79.85, "step": 800, "token_acc": 0.5363815142576205, "train_speed(iter/s)": 0.207628 }, { "epoch": 0.3100924499229584, "grad_norm": 0.4977465569972992, "learning_rate": 0.00012403196066415508, "loss": 2.1467048645019533, "memory(GiB)": 79.85, "step": 805, "token_acc": 0.5474415016713808, "train_speed(iter/s)": 0.207779 }, { "epoch": 0.3120184899845917, "grad_norm": 1.7817529439926147, "learning_rate": 0.00012400855613353974, "loss": 2.1157253265380858, "memory(GiB)": 79.85, "step": 810, "token_acc": 0.5336831059811122, "train_speed(iter/s)": 0.207152 }, { "epoch": 0.31394453004622497, "grad_norm": 1.0420174598693848, "learning_rate": 0.00012398487430509541, "loss": 2.1837884902954103, "memory(GiB)": 79.85, "step": 815, "token_acc": 0.5418866192334175, "train_speed(iter/s)": 0.207897 }, { "epoch": 0.31587057010785824, "grad_norm": 0.8049368262290955, "learning_rate": 0.00012396091528558647, "loss": 2.0642932891845702, "memory(GiB)": 79.85, "step": 820, "token_acc": 0.5254824344383968, "train_speed(iter/s)": 0.207387 }, { "epoch": 0.3177966101694915, "grad_norm": 0.7703681588172913, "learning_rate": 0.0001239366791830269, "loss": 2.1248165130615235, "memory(GiB)": 79.85, "step": 825, "token_acc": 0.5299837925445705, "train_speed(iter/s)": 0.207841 }, { "epoch": 0.3197226502311248, "grad_norm": 0.7251123189926147, "learning_rate": 0.00012391216610667987, "loss": 2.119538116455078, "memory(GiB)": 79.85, "step": 830, "token_acc": 0.5522290920924179, "train_speed(iter/s)": 0.206827 }, { "epoch": 0.3216486902927581, "grad_norm": 2.997692823410034, "learning_rate": 0.00012388737616705718, "loss": 2.15743408203125, "memory(GiB)": 79.85, "step": 835, "token_acc": 0.5239942822136001, "train_speed(iter/s)": 0.207532 }, { "epoch": 0.3235747303543914, "grad_norm": 0.6147775053977966, "learning_rate": 0.00012386230947591882, "loss": 2.089567947387695, "memory(GiB)": 79.85, "step": 840, "token_acc": 0.5160835876966424, "train_speed(iter/s)": 0.208252 }, { "epoch": 0.32550077041602465, "grad_norm": 0.7132768630981445, "learning_rate": 0.0001238369661462725, "loss": 2.1357202529907227, "memory(GiB)": 79.85, "step": 845, "token_acc": 0.5417991821899136, "train_speed(iter/s)": 0.207421 }, { "epoch": 0.3274268104776579, "grad_norm": 1.0247437953948975, "learning_rate": 0.00012381134629237302, "loss": 2.1768089294433595, "memory(GiB)": 79.85, "step": 850, "token_acc": 0.5084491978609625, "train_speed(iter/s)": 0.208129 }, { "epoch": 0.3293528505392912, "grad_norm": 1.1053919792175293, "learning_rate": 0.0001237854500297219, "loss": 2.145914840698242, "memory(GiB)": 79.85, "step": 855, "token_acc": 0.5334768053562888, "train_speed(iter/s)": 0.207464 }, { "epoch": 0.3312788906009245, "grad_norm": 0.6999503374099731, "learning_rate": 0.00012375927747506677, "loss": 2.1366676330566405, "memory(GiB)": 79.85, "step": 860, "token_acc": 0.5351328191945158, "train_speed(iter/s)": 0.20817 }, { "epoch": 0.3332049306625578, "grad_norm": 1.1189074516296387, "learning_rate": 0.0001237328287464008, "loss": 2.0361764907836912, "memory(GiB)": 79.85, "step": 865, "token_acc": 0.5393548387096774, "train_speed(iter/s)": 0.208608 }, { "epoch": 0.33513097072419107, "grad_norm": 1.0416418313980103, "learning_rate": 0.00012370610396296236, "loss": 2.035050964355469, "memory(GiB)": 79.85, "step": 870, "token_acc": 0.551981252662974, "train_speed(iter/s)": 0.20817 }, { "epoch": 0.33705701078582434, "grad_norm": 1.1505193710327148, "learning_rate": 0.0001236791032452342, "loss": 2.038909912109375, "memory(GiB)": 79.85, "step": 875, "token_acc": 0.5669099756690997, "train_speed(iter/s)": 0.208772 }, { "epoch": 0.3389830508474576, "grad_norm": 1.1256943941116333, "learning_rate": 0.00012365182671494318, "loss": 2.0859130859375, "memory(GiB)": 79.85, "step": 880, "token_acc": 0.539801596902976, "train_speed(iter/s)": 0.20818 }, { "epoch": 0.3409090909090909, "grad_norm": 1.0799412727355957, "learning_rate": 0.0001236242744950595, "loss": 2.125068473815918, "memory(GiB)": 79.85, "step": 885, "token_acc": 0.5248287671232876, "train_speed(iter/s)": 0.208844 }, { "epoch": 0.3428351309707242, "grad_norm": 1.5209028720855713, "learning_rate": 0.00012359644670979634, "loss": 2.077609825134277, "memory(GiB)": 79.85, "step": 890, "token_acc": 0.5318967356518028, "train_speed(iter/s)": 0.207845 }, { "epoch": 0.3447611710323575, "grad_norm": 1.0139696598052979, "learning_rate": 0.00012356834348460914, "loss": 2.0877641677856444, "memory(GiB)": 79.85, "step": 895, "token_acc": 0.5409986257443885, "train_speed(iter/s)": 0.208519 }, { "epoch": 0.34668721109399075, "grad_norm": 0.8776059746742249, "learning_rate": 0.00012353996494619512, "loss": 2.134198760986328, "memory(GiB)": 79.85, "step": 900, "token_acc": 0.5481927710843374, "train_speed(iter/s)": 0.209172 }, { "epoch": 0.348613251155624, "grad_norm": 0.6768463253974915, "learning_rate": 0.00012351131122249274, "loss": 2.0584712982177735, "memory(GiB)": 79.85, "step": 905, "token_acc": 0.517769130998703, "train_speed(iter/s)": 0.208188 }, { "epoch": 0.3505392912172573, "grad_norm": 0.6463296413421631, "learning_rate": 0.00012348238244268097, "loss": 2.142026901245117, "memory(GiB)": 79.85, "step": 910, "token_acc": 0.5444, "train_speed(iter/s)": 0.208829 }, { "epoch": 0.3524653312788906, "grad_norm": 0.7297253012657166, "learning_rate": 0.0001234531787371789, "loss": 2.094883346557617, "memory(GiB)": 79.85, "step": 915, "token_acc": 0.5353482260183968, "train_speed(iter/s)": 0.20826 }, { "epoch": 0.3543913713405239, "grad_norm": 1.432271957397461, "learning_rate": 0.000123423700237645, "loss": 2.0353137969970705, "memory(GiB)": 79.85, "step": 920, "token_acc": 0.5465734265734266, "train_speed(iter/s)": 0.208915 }, { "epoch": 0.35631741140215717, "grad_norm": 0.49493953585624695, "learning_rate": 0.00012339394707697665, "loss": 2.091717529296875, "memory(GiB)": 79.85, "step": 925, "token_acc": 0.5342435586875137, "train_speed(iter/s)": 0.209559 }, { "epoch": 0.35824345146379044, "grad_norm": 0.9767318367958069, "learning_rate": 0.00012336391938930943, "loss": 2.0874820709228517, "memory(GiB)": 79.85, "step": 930, "token_acc": 0.5363825363825364, "train_speed(iter/s)": 0.209431 }, { "epoch": 0.3601694915254237, "grad_norm": 0.7268040776252747, "learning_rate": 0.00012333361731001657, "loss": 2.15291748046875, "memory(GiB)": 79.85, "step": 935, "token_acc": 0.5481201229605107, "train_speed(iter/s)": 0.209953 }, { "epoch": 0.362095531587057, "grad_norm": 1.4657659530639648, "learning_rate": 0.00012330304097570838, "loss": 2.0440414428710936, "memory(GiB)": 79.85, "step": 940, "token_acc": 0.5642281105990783, "train_speed(iter/s)": 0.209602 }, { "epoch": 0.3640215716486903, "grad_norm": 0.7875342965126038, "learning_rate": 0.0001232721905242315, "loss": 2.0545331954956056, "memory(GiB)": 79.85, "step": 945, "token_acc": 0.5512609649122807, "train_speed(iter/s)": 0.210242 }, { "epoch": 0.3659476117103236, "grad_norm": 0.846772313117981, "learning_rate": 0.00012324106609466848, "loss": 2.015234375, "memory(GiB)": 79.85, "step": 950, "token_acc": 0.5592188688815622, "train_speed(iter/s)": 0.209286 }, { "epoch": 0.36787365177195686, "grad_norm": 0.717317521572113, "learning_rate": 0.00012320966782733693, "loss": 2.0592109680175783, "memory(GiB)": 79.85, "step": 955, "token_acc": 0.5464055196973069, "train_speed(iter/s)": 0.209915 }, { "epoch": 0.3697996918335901, "grad_norm": 0.7228723168373108, "learning_rate": 0.0001231779958637891, "loss": 2.084528350830078, "memory(GiB)": 79.85, "step": 960, "token_acc": 0.5468301591442735, "train_speed(iter/s)": 0.210547 }, { "epoch": 0.3717257318952234, "grad_norm": 0.9915047287940979, "learning_rate": 0.00012314605034681103, "loss": 2.0678550720214846, "memory(GiB)": 79.85, "step": 965, "token_acc": 0.5451188552965612, "train_speed(iter/s)": 0.210174 }, { "epoch": 0.3736517719568567, "grad_norm": 0.8277711272239685, "learning_rate": 0.00012311383142042212, "loss": 2.031156539916992, "memory(GiB)": 79.85, "step": 970, "token_acc": 0.5483870967741935, "train_speed(iter/s)": 0.210654 }, { "epoch": 0.37557781201849, "grad_norm": 1.8129619359970093, "learning_rate": 0.00012308133922987432, "loss": 2.0359249114990234, "memory(GiB)": 92.51, "step": 975, "token_acc": 0.5392670157068062, "train_speed(iter/s)": 0.209557 }, { "epoch": 0.37750385208012327, "grad_norm": 0.8173950910568237, "learning_rate": 0.00012304857392165153, "loss": 2.081368827819824, "memory(GiB)": 92.51, "step": 980, "token_acc": 0.5533149171270718, "train_speed(iter/s)": 0.210163 }, { "epoch": 0.37942989214175654, "grad_norm": 0.8520150780677795, "learning_rate": 0.00012301553564346895, "loss": 2.062424087524414, "memory(GiB)": 92.51, "step": 985, "token_acc": 0.571071071071071, "train_speed(iter/s)": 0.210491 }, { "epoch": 0.3813559322033898, "grad_norm": 1.1772634983062744, "learning_rate": 0.00012298222454427244, "loss": 1.996800422668457, "memory(GiB)": 92.51, "step": 990, "token_acc": 0.5325443786982249, "train_speed(iter/s)": 0.20997 }, { "epoch": 0.3832819722650231, "grad_norm": 0.8828487396240234, "learning_rate": 0.00012294864077423774, "loss": 2.073063278198242, "memory(GiB)": 92.51, "step": 995, "token_acc": 0.5498062457260087, "train_speed(iter/s)": 0.210097 }, { "epoch": 0.3852080123266564, "grad_norm": 2.339871644973755, "learning_rate": 0.00012291478448476993, "loss": 2.0193538665771484, "memory(GiB)": 105.37, "step": 1000, "token_acc": 0.5315152609716453, "train_speed(iter/s)": 0.209688 }, { "epoch": 0.3871340523882897, "grad_norm": 0.5021800398826599, "learning_rate": 0.00012288065582850266, "loss": 2.0437103271484376, "memory(GiB)": 105.37, "step": 1005, "token_acc": 0.5345794392523364, "train_speed(iter/s)": 0.210274 }, { "epoch": 0.38906009244992296, "grad_norm": 1.310742974281311, "learning_rate": 0.00012284625495929749, "loss": 2.1039939880371095, "memory(GiB)": 105.37, "step": 1010, "token_acc": 0.5590607210626186, "train_speed(iter/s)": 0.209347 }, { "epoch": 0.39098613251155623, "grad_norm": 0.8727560639381409, "learning_rate": 0.00012281158203224316, "loss": 1.9523155212402343, "memory(GiB)": 105.37, "step": 1015, "token_acc": 0.552047096601552, "train_speed(iter/s)": 0.209949 }, { "epoch": 0.3929121725731895, "grad_norm": 0.7556589841842651, "learning_rate": 0.000122776637203655, "loss": 2.044467544555664, "memory(GiB)": 105.37, "step": 1020, "token_acc": 0.5644420426911646, "train_speed(iter/s)": 0.210211 }, { "epoch": 0.3948382126348228, "grad_norm": 1.5188084840774536, "learning_rate": 0.0001227414206310741, "loss": 2.046164131164551, "memory(GiB)": 105.37, "step": 1025, "token_acc": 0.5623644251626898, "train_speed(iter/s)": 0.209087 }, { "epoch": 0.3967642526964561, "grad_norm": 0.6403911113739014, "learning_rate": 0.00012270593247326662, "loss": 2.028892707824707, "memory(GiB)": 105.37, "step": 1030, "token_acc": 0.5631252977608385, "train_speed(iter/s)": 0.209665 }, { "epoch": 0.39869029275808937, "grad_norm": 0.8856572508811951, "learning_rate": 0.00012267017289022315, "loss": 2.013199806213379, "memory(GiB)": 105.37, "step": 1035, "token_acc": 0.5521528897075754, "train_speed(iter/s)": 0.209096 }, { "epoch": 0.40061633281972264, "grad_norm": 1.5891669988632202, "learning_rate": 0.0001226341420431579, "loss": 2.0458957672119142, "memory(GiB)": 105.37, "step": 1040, "token_acc": 0.5475583864118896, "train_speed(iter/s)": 0.209668 }, { "epoch": 0.4025423728813559, "grad_norm": 0.733910083770752, "learning_rate": 0.00012259784009450807, "loss": 2.070827865600586, "memory(GiB)": 105.37, "step": 1045, "token_acc": 0.5413500223513634, "train_speed(iter/s)": 0.209886 }, { "epoch": 0.40446841294298924, "grad_norm": 1.6674824953079224, "learning_rate": 0.000122561267207933, "loss": 2.0968223571777345, "memory(GiB)": 105.37, "step": 1050, "token_acc": 0.5612293144208038, "train_speed(iter/s)": 0.209802 }, { "epoch": 0.4063944530046225, "grad_norm": 3.2688026428222656, "learning_rate": 0.00012252442354831358, "loss": 2.0730255126953123, "memory(GiB)": 105.37, "step": 1055, "token_acc": 0.5779054916985952, "train_speed(iter/s)": 0.209444 }, { "epoch": 0.4083204930662558, "grad_norm": 1.2243387699127197, "learning_rate": 0.0001224873092817513, "loss": 2.079141616821289, "memory(GiB)": 105.37, "step": 1060, "token_acc": 0.5400244798041616, "train_speed(iter/s)": 0.209607 }, { "epoch": 0.41024653312788906, "grad_norm": 0.8547586798667908, "learning_rate": 0.0001224499245755677, "loss": 2.0916282653808596, "memory(GiB)": 105.37, "step": 1065, "token_acc": 0.5481445549357264, "train_speed(iter/s)": 0.210169 }, { "epoch": 0.41217257318952233, "grad_norm": 1.0343953371047974, "learning_rate": 0.00012241226959830355, "loss": 2.0095287322998048, "memory(GiB)": 105.37, "step": 1070, "token_acc": 0.561633281972265, "train_speed(iter/s)": 0.209478 }, { "epoch": 0.4140986132511556, "grad_norm": 0.5994991660118103, "learning_rate": 0.00012237434451971806, "loss": 2.0404300689697266, "memory(GiB)": 105.37, "step": 1075, "token_acc": 0.5338888888888889, "train_speed(iter/s)": 0.209944 }, { "epoch": 0.41602465331278893, "grad_norm": 0.4578043818473816, "learning_rate": 0.0001223361495107881, "loss": 2.0485496520996094, "memory(GiB)": 105.37, "step": 1080, "token_acc": 0.545324085147094, "train_speed(iter/s)": 0.209655 }, { "epoch": 0.4179506933744222, "grad_norm": 0.5585042238235474, "learning_rate": 0.00012229768474370748, "loss": 2.0737884521484373, "memory(GiB)": 105.37, "step": 1085, "token_acc": 0.5437039833868227, "train_speed(iter/s)": 0.210085 }, { "epoch": 0.41987673343605547, "grad_norm": 0.711057186126709, "learning_rate": 0.00012225895039188618, "loss": 2.0477458953857424, "memory(GiB)": 105.37, "step": 1090, "token_acc": 0.5625491738788355, "train_speed(iter/s)": 0.210651 }, { "epoch": 0.42180277349768874, "grad_norm": 2.2334554195404053, "learning_rate": 0.00012221994662994952, "loss": 2.0743385314941407, "memory(GiB)": 105.37, "step": 1095, "token_acc": 0.5573217726396917, "train_speed(iter/s)": 0.210032 }, { "epoch": 0.423728813559322, "grad_norm": 0.5117713809013367, "learning_rate": 0.00012218067363373739, "loss": 2.0117897033691405, "memory(GiB)": 105.37, "step": 1100, "token_acc": 0.5353863810252487, "train_speed(iter/s)": 0.210353 }, { "epoch": 0.42565485362095534, "grad_norm": 1.5961309671401978, "learning_rate": 0.0001221411315803035, "loss": 1.9560466766357423, "memory(GiB)": 105.37, "step": 1105, "token_acc": 0.5727002967359051, "train_speed(iter/s)": 0.21031 }, { "epoch": 0.4275808936825886, "grad_norm": 0.7415860295295715, "learning_rate": 0.00012210132064791453, "loss": 2.0616329193115233, "memory(GiB)": 105.37, "step": 1110, "token_acc": 0.5493295019157088, "train_speed(iter/s)": 0.210041 }, { "epoch": 0.4295069337442219, "grad_norm": 0.7390707731246948, "learning_rate": 0.00012206124101604929, "loss": 2.054303741455078, "memory(GiB)": 105.37, "step": 1115, "token_acc": 0.5525114155251142, "train_speed(iter/s)": 0.20999 }, { "epoch": 0.43143297380585516, "grad_norm": 0.5878385305404663, "learning_rate": 0.00012202089286539803, "loss": 2.0334293365478517, "memory(GiB)": 105.37, "step": 1120, "token_acc": 0.547119249665029, "train_speed(iter/s)": 0.209834 }, { "epoch": 0.43335901386748843, "grad_norm": 0.7637941837310791, "learning_rate": 0.00012198027637786155, "loss": 2.0259563446044924, "memory(GiB)": 105.37, "step": 1125, "token_acc": 0.5531969309462915, "train_speed(iter/s)": 0.210238 }, { "epoch": 0.4352850539291217, "grad_norm": 0.7901144027709961, "learning_rate": 0.00012193939173655033, "loss": 2.0190959930419923, "memory(GiB)": 105.37, "step": 1130, "token_acc": 0.5437619961612284, "train_speed(iter/s)": 0.209714 }, { "epoch": 0.43721109399075503, "grad_norm": 0.9945278167724609, "learning_rate": 0.00012189823912578385, "loss": 1.9761981964111328, "memory(GiB)": 105.37, "step": 1135, "token_acc": 0.5514848737163475, "train_speed(iter/s)": 0.210248 }, { "epoch": 0.4391371340523883, "grad_norm": 0.6760552525520325, "learning_rate": 0.00012185681873108962, "loss": 1.9804224014282226, "memory(GiB)": 105.37, "step": 1140, "token_acc": 0.5512299976116551, "train_speed(iter/s)": 0.209898 }, { "epoch": 0.4410631741140216, "grad_norm": 1.1441941261291504, "learning_rate": 0.00012181513073920237, "loss": 2.0174320220947264, "memory(GiB)": 105.37, "step": 1145, "token_acc": 0.555012853470437, "train_speed(iter/s)": 0.209709 }, { "epoch": 0.44298921417565484, "grad_norm": 1.7252224683761597, "learning_rate": 0.00012177317533806327, "loss": 2.0251365661621095, "memory(GiB)": 105.37, "step": 1150, "token_acc": 0.544793182290584, "train_speed(iter/s)": 0.210224 }, { "epoch": 0.4449152542372881, "grad_norm": 1.856744408607483, "learning_rate": 0.00012173095271681905, "loss": 2.0513368606567384, "memory(GiB)": 105.37, "step": 1155, "token_acc": 0.5461949605497582, "train_speed(iter/s)": 0.209507 }, { "epoch": 0.44684129429892144, "grad_norm": 0.6724086999893188, "learning_rate": 0.00012168846306582115, "loss": 2.039206695556641, "memory(GiB)": 105.37, "step": 1160, "token_acc": 0.5597987651497828, "train_speed(iter/s)": 0.210015 }, { "epoch": 0.4487673343605547, "grad_norm": 0.6890406012535095, "learning_rate": 0.00012164570657662482, "loss": 2.0192028045654298, "memory(GiB)": 105.37, "step": 1165, "token_acc": 0.5484396200814111, "train_speed(iter/s)": 0.209598 }, { "epoch": 0.450693374422188, "grad_norm": 0.6652777791023254, "learning_rate": 0.00012160268344198832, "loss": 1.9650936126708984, "memory(GiB)": 105.37, "step": 1170, "token_acc": 0.537867410426947, "train_speed(iter/s)": 0.209734 }, { "epoch": 0.45261941448382126, "grad_norm": 0.9391166567802429, "learning_rate": 0.00012155939385587201, "loss": 2.0331436157226563, "memory(GiB)": 105.37, "step": 1175, "token_acc": 0.5479643056330172, "train_speed(iter/s)": 0.209284 }, { "epoch": 0.45454545454545453, "grad_norm": 0.6270633935928345, "learning_rate": 0.00012151583801343746, "loss": 2.079738235473633, "memory(GiB)": 105.37, "step": 1180, "token_acc": 0.5605736301369864, "train_speed(iter/s)": 0.209321 }, { "epoch": 0.4564714946070878, "grad_norm": 1.0157898664474487, "learning_rate": 0.00012147201611104667, "loss": 2.0804901123046875, "memory(GiB)": 105.37, "step": 1185, "token_acc": 0.5490492001207365, "train_speed(iter/s)": 0.209828 }, { "epoch": 0.45839753466872113, "grad_norm": 0.6536192893981934, "learning_rate": 0.00012142792834626104, "loss": 2.0880712509155273, "memory(GiB)": 105.37, "step": 1190, "token_acc": 0.5626702997275205, "train_speed(iter/s)": 0.209129 }, { "epoch": 0.4603235747303544, "grad_norm": 2.072760581970215, "learning_rate": 0.0001213835749178406, "loss": 2.013889503479004, "memory(GiB)": 105.37, "step": 1195, "token_acc": 0.5395019321597252, "train_speed(iter/s)": 0.209629 }, { "epoch": 0.4622496147919877, "grad_norm": 0.7244282364845276, "learning_rate": 0.00012133895602574308, "loss": 2.0632280349731444, "memory(GiB)": 105.37, "step": 1200, "token_acc": 0.5461600214075462, "train_speed(iter/s)": 0.209666 }, { "epoch": 0.46417565485362094, "grad_norm": 2.0147016048431396, "learning_rate": 0.0001212940718711229, "loss": 2.0078060150146486, "memory(GiB)": 105.37, "step": 1205, "token_acc": 0.5640074211502782, "train_speed(iter/s)": 0.209231 }, { "epoch": 0.4661016949152542, "grad_norm": 1.7751325368881226, "learning_rate": 0.00012124892265633046, "loss": 2.0283557891845705, "memory(GiB)": 105.37, "step": 1210, "token_acc": 0.5644631973745898, "train_speed(iter/s)": 0.209721 }, { "epoch": 0.46802773497688754, "grad_norm": 0.8284670114517212, "learning_rate": 0.00012120350858491108, "loss": 2.037373733520508, "memory(GiB)": 105.37, "step": 1215, "token_acc": 0.5542967079948696, "train_speed(iter/s)": 0.209352 }, { "epoch": 0.4699537750385208, "grad_norm": 1.220298409461975, "learning_rate": 0.00012115782986160416, "loss": 2.0448408126831055, "memory(GiB)": 105.37, "step": 1220, "token_acc": 0.5483870967741935, "train_speed(iter/s)": 0.209837 }, { "epoch": 0.4718798151001541, "grad_norm": 1.0690405368804932, "learning_rate": 0.00012111188669234216, "loss": 2.0168430328369142, "memory(GiB)": 105.37, "step": 1225, "token_acc": 0.5540720961281709, "train_speed(iter/s)": 0.209615 }, { "epoch": 0.47380585516178736, "grad_norm": 3.044036626815796, "learning_rate": 0.00012106567928424981, "loss": 2.089277458190918, "memory(GiB)": 105.37, "step": 1230, "token_acc": 0.5523988206915036, "train_speed(iter/s)": 0.209705 }, { "epoch": 0.47573189522342063, "grad_norm": 0.8940361738204956, "learning_rate": 0.00012101920784564306, "loss": 2.023123931884766, "memory(GiB)": 105.37, "step": 1235, "token_acc": 0.5507856341189674, "train_speed(iter/s)": 0.209654 }, { "epoch": 0.4776579352850539, "grad_norm": 0.9247569441795349, "learning_rate": 0.00012097247258602819, "loss": 2.014914321899414, "memory(GiB)": 105.37, "step": 1240, "token_acc": 0.5493201483312732, "train_speed(iter/s)": 0.209393 }, { "epoch": 0.47958397534668723, "grad_norm": 0.6719440221786499, "learning_rate": 0.00012092547371610085, "loss": 1.9490089416503906, "memory(GiB)": 105.37, "step": 1245, "token_acc": 0.5732605729877217, "train_speed(iter/s)": 0.20988 }, { "epoch": 0.4815100154083205, "grad_norm": 0.70192950963974, "learning_rate": 0.00012087821144774518, "loss": 1.9983936309814454, "memory(GiB)": 105.37, "step": 1250, "token_acc": 0.5967137503603344, "train_speed(iter/s)": 0.20942 }, { "epoch": 0.4834360554699538, "grad_norm": 1.071979284286499, "learning_rate": 0.00012083068599403269, "loss": 2.0260143280029297, "memory(GiB)": 105.37, "step": 1255, "token_acc": 0.5576756287944492, "train_speed(iter/s)": 0.209904 }, { "epoch": 0.48536209553158705, "grad_norm": 0.8790524005889893, "learning_rate": 0.0001207828975692215, "loss": 1.9632652282714844, "memory(GiB)": 105.37, "step": 1260, "token_acc": 0.5521518987341772, "train_speed(iter/s)": 0.209838 }, { "epoch": 0.4872881355932203, "grad_norm": 1.2352432012557983, "learning_rate": 0.0001207348463887552, "loss": 2.0295257568359375, "memory(GiB)": 105.37, "step": 1265, "token_acc": 0.5505913272010512, "train_speed(iter/s)": 0.209822 }, { "epoch": 0.48921417565485364, "grad_norm": 1.1282159090042114, "learning_rate": 0.00012068653266926205, "loss": 2.0238704681396484, "memory(GiB)": 105.37, "step": 1270, "token_acc": 0.5539687811358353, "train_speed(iter/s)": 0.210292 }, { "epoch": 0.4911402157164869, "grad_norm": 0.6603449583053589, "learning_rate": 0.00012063795662855379, "loss": 2.0347692489624025, "memory(GiB)": 105.37, "step": 1275, "token_acc": 0.5481445549357264, "train_speed(iter/s)": 0.209939 }, { "epoch": 0.4930662557781202, "grad_norm": 0.5944059491157532, "learning_rate": 0.00012058911848562488, "loss": 2.025372314453125, "memory(GiB)": 105.37, "step": 1280, "token_acc": 0.5380639097744361, "train_speed(iter/s)": 0.210292 }, { "epoch": 0.49499229583975346, "grad_norm": 0.7217702865600586, "learning_rate": 0.00012054001846065136, "loss": 2.023514747619629, "memory(GiB)": 105.37, "step": 1285, "token_acc": 0.5491269220745374, "train_speed(iter/s)": 0.210254 }, { "epoch": 0.49691833590138673, "grad_norm": 0.8489204049110413, "learning_rate": 0.00012049065677498994, "loss": 1.959089469909668, "memory(GiB)": 105.37, "step": 1290, "token_acc": 0.5679075738125803, "train_speed(iter/s)": 0.210134 }, { "epoch": 0.49884437596302, "grad_norm": 0.8508457541465759, "learning_rate": 0.00012044103365117689, "loss": 1.9402631759643554, "memory(GiB)": 105.37, "step": 1295, "token_acc": 0.5967606813739179, "train_speed(iter/s)": 0.209897 }, { "epoch": 0.5007704160246533, "grad_norm": 0.7315754294395447, "learning_rate": 0.00012039114931292725, "loss": 2.0376415252685547, "memory(GiB)": 105.37, "step": 1300, "token_acc": 0.5633968478005176, "train_speed(iter/s)": 0.210351 }, { "epoch": 0.5026964560862865, "grad_norm": 0.4978732168674469, "learning_rate": 0.00012034100398513356, "loss": 1.9862529754638671, "memory(GiB)": 105.37, "step": 1305, "token_acc": 0.5464994775339603, "train_speed(iter/s)": 0.21037 }, { "epoch": 0.5046224961479199, "grad_norm": 0.7517293095588684, "learning_rate": 0.00012029059789386503, "loss": 1.9807701110839844, "memory(GiB)": 105.37, "step": 1310, "token_acc": 0.5634867689570825, "train_speed(iter/s)": 0.210447 }, { "epoch": 0.5065485362095532, "grad_norm": 2.2905900478363037, "learning_rate": 0.00012023993126636651, "loss": 2.0183515548706055, "memory(GiB)": 105.37, "step": 1315, "token_acc": 0.5445933456561922, "train_speed(iter/s)": 0.210508 }, { "epoch": 0.5084745762711864, "grad_norm": 0.9722186326980591, "learning_rate": 0.0001201890043310573, "loss": 1.9719818115234375, "memory(GiB)": 105.37, "step": 1320, "token_acc": 0.5350995938889963, "train_speed(iter/s)": 0.210529 }, { "epoch": 0.5104006163328197, "grad_norm": 0.57307368516922, "learning_rate": 0.00012013781731753039, "loss": 2.02282829284668, "memory(GiB)": 105.37, "step": 1325, "token_acc": 0.5638364127050031, "train_speed(iter/s)": 0.210976 }, { "epoch": 0.512326656394453, "grad_norm": 0.6921036243438721, "learning_rate": 0.00012008637045655114, "loss": 1.9853046417236329, "memory(GiB)": 105.37, "step": 1330, "token_acc": 0.5558528428093645, "train_speed(iter/s)": 0.210909 }, { "epoch": 0.5142526964560863, "grad_norm": 0.7683034539222717, "learning_rate": 0.00012003466398005647, "loss": 1.942391586303711, "memory(GiB)": 105.37, "step": 1335, "token_acc": 0.5475708502024291, "train_speed(iter/s)": 0.210705 }, { "epoch": 0.5161787365177196, "grad_norm": 0.990985631942749, "learning_rate": 0.00011998269812115366, "loss": 2.008869171142578, "memory(GiB)": 105.37, "step": 1340, "token_acc": 0.5429460580912863, "train_speed(iter/s)": 0.210751 }, { "epoch": 0.5181047765793528, "grad_norm": 1.4317958354949951, "learning_rate": 0.00011993047311411939, "loss": 2.0736225128173826, "memory(GiB)": 105.37, "step": 1345, "token_acc": 0.5566418703506908, "train_speed(iter/s)": 0.210625 }, { "epoch": 0.5200308166409862, "grad_norm": 0.6179465651512146, "learning_rate": 0.00011987798919439865, "loss": 1.9483587265014648, "memory(GiB)": 105.37, "step": 1350, "token_acc": 0.5767310614282614, "train_speed(iter/s)": 0.210382 }, { "epoch": 0.5219568567026194, "grad_norm": 0.6897500157356262, "learning_rate": 0.00011982524659860366, "loss": 1.959177589416504, "memory(GiB)": 105.37, "step": 1355, "token_acc": 0.5470760894107022, "train_speed(iter/s)": 0.210364 }, { "epoch": 0.5238828967642527, "grad_norm": 1.302018642425537, "learning_rate": 0.00011977224556451289, "loss": 2.018106460571289, "memory(GiB)": 105.37, "step": 1360, "token_acc": 0.5561760107214653, "train_speed(iter/s)": 0.210806 }, { "epoch": 0.525808936825886, "grad_norm": 0.897825300693512, "learning_rate": 0.00011971898633106979, "loss": 1.971597671508789, "memory(GiB)": 105.37, "step": 1365, "token_acc": 0.5543684710351378, "train_speed(iter/s)": 0.210405 }, { "epoch": 0.5277349768875192, "grad_norm": 0.8042570352554321, "learning_rate": 0.000119665469138382, "loss": 1.9955223083496094, "memory(GiB)": 105.37, "step": 1370, "token_acc": 0.5700998185117967, "train_speed(iter/s)": 0.210695 }, { "epoch": 0.5296610169491526, "grad_norm": 0.6321896910667419, "learning_rate": 0.00011961169422772, "loss": 1.998664093017578, "memory(GiB)": 105.37, "step": 1375, "token_acc": 0.5600081366965012, "train_speed(iter/s)": 0.210262 }, { "epoch": 0.5315870570107858, "grad_norm": 0.8121838569641113, "learning_rate": 0.0001195576618415162, "loss": 1.9670547485351562, "memory(GiB)": 105.37, "step": 1380, "token_acc": 0.5784518828451883, "train_speed(iter/s)": 0.210294 }, { "epoch": 0.5335130970724191, "grad_norm": 0.7805467247962952, "learning_rate": 0.00011950337222336374, "loss": 2.026367950439453, "memory(GiB)": 105.37, "step": 1385, "token_acc": 0.5629067245119306, "train_speed(iter/s)": 0.210719 }, { "epoch": 0.5354391371340523, "grad_norm": 0.6697444915771484, "learning_rate": 0.00011944882561801545, "loss": 2.056959533691406, "memory(GiB)": 105.37, "step": 1390, "token_acc": 0.5635869565217392, "train_speed(iter/s)": 0.210364 }, { "epoch": 0.5373651771956857, "grad_norm": 0.5845000743865967, "learning_rate": 0.00011939402227138275, "loss": 1.9832889556884765, "memory(GiB)": 105.37, "step": 1395, "token_acc": 0.5597981127935044, "train_speed(iter/s)": 0.210801 }, { "epoch": 0.539291217257319, "grad_norm": 0.7413605451583862, "learning_rate": 0.0001193389624305345, "loss": 1.9535972595214843, "memory(GiB)": 105.37, "step": 1400, "token_acc": 0.5776587605202754, "train_speed(iter/s)": 0.210204 }, { "epoch": 0.5412172573189522, "grad_norm": 0.7914743423461914, "learning_rate": 0.00011928364634369587, "loss": 1.9574665069580077, "memory(GiB)": 105.37, "step": 1405, "token_acc": 0.5467493682517803, "train_speed(iter/s)": 0.210619 }, { "epoch": 0.5431432973805855, "grad_norm": 0.7502923607826233, "learning_rate": 0.00011922807426024737, "loss": 1.9930837631225586, "memory(GiB)": 105.37, "step": 1410, "token_acc": 0.557456034690436, "train_speed(iter/s)": 0.210322 }, { "epoch": 0.5450693374422187, "grad_norm": 1.183559536933899, "learning_rate": 0.00011917224643072349, "loss": 2.017503356933594, "memory(GiB)": 105.37, "step": 1415, "token_acc": 0.5502546234253551, "train_speed(iter/s)": 0.210705 }, { "epoch": 0.5469953775038521, "grad_norm": 0.7133117914199829, "learning_rate": 0.00011911616310681175, "loss": 1.999475860595703, "memory(GiB)": 105.37, "step": 1420, "token_acc": 0.5499178307313065, "train_speed(iter/s)": 0.211131 }, { "epoch": 0.5489214175654854, "grad_norm": 0.9616044163703918, "learning_rate": 0.00011905982454135156, "loss": 1.9801986694335938, "memory(GiB)": 105.37, "step": 1425, "token_acc": 0.5656905934179839, "train_speed(iter/s)": 0.210607 }, { "epoch": 0.5508474576271186, "grad_norm": 0.8774197697639465, "learning_rate": 0.00011900323098833292, "loss": 2.008523941040039, "memory(GiB)": 105.37, "step": 1430, "token_acc": 0.5603057081442561, "train_speed(iter/s)": 0.210986 }, { "epoch": 0.552773497688752, "grad_norm": 1.7564359903335571, "learning_rate": 0.00011894638270289548, "loss": 2.0222816467285156, "memory(GiB)": 105.37, "step": 1435, "token_acc": 0.5521039876624807, "train_speed(iter/s)": 0.210573 }, { "epoch": 0.5546995377503852, "grad_norm": 0.7343314290046692, "learning_rate": 0.00011888927994132726, "loss": 2.0308483123779295, "memory(GiB)": 105.37, "step": 1440, "token_acc": 0.543450722067393, "train_speed(iter/s)": 0.210983 }, { "epoch": 0.5566255778120185, "grad_norm": 0.7535374760627747, "learning_rate": 0.00011883192296106352, "loss": 1.9528327941894532, "memory(GiB)": 105.37, "step": 1445, "token_acc": 0.572887247447317, "train_speed(iter/s)": 0.2114 }, { "epoch": 0.5585516178736518, "grad_norm": 0.8439003229141235, "learning_rate": 0.00011877431202068561, "loss": 2.0099605560302733, "memory(GiB)": 105.37, "step": 1450, "token_acc": 0.5727204220045214, "train_speed(iter/s)": 0.21098 }, { "epoch": 0.560477657935285, "grad_norm": 1.056840181350708, "learning_rate": 0.00011871644737991985, "loss": 1.9874114990234375, "memory(GiB)": 105.37, "step": 1455, "token_acc": 0.5524736079486648, "train_speed(iter/s)": 0.211386 }, { "epoch": 0.5624036979969184, "grad_norm": 1.0296924114227295, "learning_rate": 0.00011865832929963624, "loss": 2.0156904220581056, "memory(GiB)": 105.37, "step": 1460, "token_acc": 0.5577239595579591, "train_speed(iter/s)": 0.21065 }, { "epoch": 0.5643297380585516, "grad_norm": 0.975055456161499, "learning_rate": 0.00011859995804184743, "loss": 1.9642263412475587, "memory(GiB)": 105.37, "step": 1465, "token_acc": 0.5493017350825222, "train_speed(iter/s)": 0.211055 }, { "epoch": 0.5662557781201849, "grad_norm": 1.1791462898254395, "learning_rate": 0.00011854133386970738, "loss": 2.006403160095215, "memory(GiB)": 105.37, "step": 1470, "token_acc": 0.5592257521565327, "train_speed(iter/s)": 0.210611 }, { "epoch": 0.5681818181818182, "grad_norm": 1.0619311332702637, "learning_rate": 0.00011848245704751035, "loss": 2.007827377319336, "memory(GiB)": 105.37, "step": 1475, "token_acc": 0.5743907652843095, "train_speed(iter/s)": 0.211015 }, { "epoch": 0.5701078582434514, "grad_norm": 1.6089444160461426, "learning_rate": 0.00011842332784068953, "loss": 1.9360605239868165, "memory(GiB)": 105.37, "step": 1480, "token_acc": 0.5758738277919864, "train_speed(iter/s)": 0.211426 }, { "epoch": 0.5720338983050848, "grad_norm": 1.0532867908477783, "learning_rate": 0.00011836394651581602, "loss": 2.035934066772461, "memory(GiB)": 105.37, "step": 1485, "token_acc": 0.5557446808510639, "train_speed(iter/s)": 0.211122 }, { "epoch": 0.573959938366718, "grad_norm": 0.956579864025116, "learning_rate": 0.00011830431334059746, "loss": 1.949314498901367, "memory(GiB)": 105.37, "step": 1490, "token_acc": 0.5711733174508636, "train_speed(iter/s)": 0.211522 }, { "epoch": 0.5758859784283513, "grad_norm": 1.277976632118225, "learning_rate": 0.00011824442858387697, "loss": 1.9759077072143554, "memory(GiB)": 105.37, "step": 1495, "token_acc": 0.5708984892658362, "train_speed(iter/s)": 0.210946 }, { "epoch": 0.5778120184899846, "grad_norm": 0.6209989786148071, "learning_rate": 0.00011818429251563179, "loss": 1.9580814361572265, "memory(GiB)": 105.37, "step": 1500, "token_acc": 0.568087318087318, "train_speed(iter/s)": 0.211338 }, { "epoch": 0.5797380585516179, "grad_norm": 0.683822751045227, "learning_rate": 0.00011812390540697221, "loss": 1.9568645477294921, "memory(GiB)": 105.37, "step": 1505, "token_acc": 0.565050202948088, "train_speed(iter/s)": 0.211731 }, { "epoch": 0.5816640986132512, "grad_norm": 0.5764166712760925, "learning_rate": 0.00011806326753014028, "loss": 1.9968948364257812, "memory(GiB)": 105.37, "step": 1510, "token_acc": 0.553347280334728, "train_speed(iter/s)": 0.210873 }, { "epoch": 0.5835901386748844, "grad_norm": 1.346110463142395, "learning_rate": 0.00011800237915850853, "loss": 2.002476692199707, "memory(GiB)": 105.37, "step": 1515, "token_acc": 0.5652956298200514, "train_speed(iter/s)": 0.211271 }, { "epoch": 0.5855161787365177, "grad_norm": 0.9975059628486633, "learning_rate": 0.00011794124056657885, "loss": 2.0218505859375, "memory(GiB)": 105.37, "step": 1520, "token_acc": 0.5728085003622313, "train_speed(iter/s)": 0.21068 }, { "epoch": 0.587442218798151, "grad_norm": 0.7744547724723816, "learning_rate": 0.00011787985202998116, "loss": 1.9930866241455079, "memory(GiB)": 105.37, "step": 1525, "token_acc": 0.5750998003992016, "train_speed(iter/s)": 0.211079 }, { "epoch": 0.5893682588597843, "grad_norm": 1.1613783836364746, "learning_rate": 0.00011781821382547218, "loss": 1.9389902114868165, "memory(GiB)": 105.37, "step": 1530, "token_acc": 0.5658355656295075, "train_speed(iter/s)": 0.210505 }, { "epoch": 0.5912942989214176, "grad_norm": 0.9583060145378113, "learning_rate": 0.00011775632623093426, "loss": 2.0099815368652343, "memory(GiB)": 105.37, "step": 1535, "token_acc": 0.5403657448706513, "train_speed(iter/s)": 0.2109 }, { "epoch": 0.5932203389830508, "grad_norm": 0.7002604603767395, "learning_rate": 0.00011769418952537405, "loss": 1.961953353881836, "memory(GiB)": 105.37, "step": 1540, "token_acc": 0.5613072519083969, "train_speed(iter/s)": 0.211295 }, { "epoch": 0.5951463790446841, "grad_norm": 1.1121183633804321, "learning_rate": 0.0001176318039889212, "loss": 1.9862863540649414, "memory(GiB)": 105.37, "step": 1545, "token_acc": 0.5690152451586321, "train_speed(iter/s)": 0.210863 }, { "epoch": 0.5970724191063174, "grad_norm": 0.6767920851707458, "learning_rate": 0.00011756916990282729, "loss": 1.979568099975586, "memory(GiB)": 105.37, "step": 1550, "token_acc": 0.5642661804922516, "train_speed(iter/s)": 0.211253 }, { "epoch": 0.5989984591679507, "grad_norm": 0.6760869026184082, "learning_rate": 0.00011750628754946427, "loss": 1.9564386367797852, "memory(GiB)": 105.37, "step": 1555, "token_acc": 0.5620265151515151, "train_speed(iter/s)": 0.211151 }, { "epoch": 0.600924499229584, "grad_norm": 1.6391392946243286, "learning_rate": 0.00011744315721232349, "loss": 2.009170722961426, "memory(GiB)": 105.37, "step": 1560, "token_acc": 0.5419106881405563, "train_speed(iter/s)": 0.211544 }, { "epoch": 0.6028505392912172, "grad_norm": 1.3147695064544678, "learning_rate": 0.00011737977917601421, "loss": 1.9488815307617187, "memory(GiB)": 105.37, "step": 1565, "token_acc": 0.5393518518518519, "train_speed(iter/s)": 0.211935 }, { "epoch": 0.6047765793528506, "grad_norm": 2.515930414199829, "learning_rate": 0.00011731615372626239, "loss": 1.9827709197998047, "memory(GiB)": 105.37, "step": 1570, "token_acc": 0.5508474576271186, "train_speed(iter/s)": 0.21124 }, { "epoch": 0.6067026194144838, "grad_norm": 0.8269686698913574, "learning_rate": 0.00011725228114990942, "loss": 1.9226755142211913, "memory(GiB)": 105.37, "step": 1575, "token_acc": 0.553125, "train_speed(iter/s)": 0.211621 }, { "epoch": 0.6086286594761171, "grad_norm": 4.683406829833984, "learning_rate": 0.00011718816173491079, "loss": 1.9892017364501953, "memory(GiB)": 105.37, "step": 1580, "token_acc": 0.5648576295935751, "train_speed(iter/s)": 0.211337 }, { "epoch": 0.6105546995377504, "grad_norm": 0.6101524829864502, "learning_rate": 0.0001171237957703348, "loss": 1.9213462829589845, "memory(GiB)": 105.37, "step": 1585, "token_acc": 0.5619000738370662, "train_speed(iter/s)": 0.211404 }, { "epoch": 0.6124807395993837, "grad_norm": 0.8342775702476501, "learning_rate": 0.0001170591835463613, "loss": 1.9830745697021483, "memory(GiB)": 105.37, "step": 1590, "token_acc": 0.5802612481857765, "train_speed(iter/s)": 0.211363 }, { "epoch": 0.614406779661017, "grad_norm": 1.2638617753982544, "learning_rate": 0.00011699432535428034, "loss": 1.9660453796386719, "memory(GiB)": 105.37, "step": 1595, "token_acc": 0.5574653137295507, "train_speed(iter/s)": 0.211158 }, { "epoch": 0.6163328197226502, "grad_norm": 0.8382625579833984, "learning_rate": 0.0001169292214864908, "loss": 1.953329086303711, "memory(GiB)": 105.37, "step": 1600, "token_acc": 0.5601037763044104, "train_speed(iter/s)": 0.211541 }, { "epoch": 0.6182588597842835, "grad_norm": 0.7331746816635132, "learning_rate": 0.00011686387223649921, "loss": 1.951005744934082, "memory(GiB)": 105.37, "step": 1605, "token_acc": 0.5684530774631407, "train_speed(iter/s)": 0.21192 }, { "epoch": 0.6201848998459168, "grad_norm": 0.7785165905952454, "learning_rate": 0.0001167982778989183, "loss": 2.0063850402832033, "memory(GiB)": 105.37, "step": 1610, "token_acc": 0.5563857109502685, "train_speed(iter/s)": 0.211114 }, { "epoch": 0.6221109399075501, "grad_norm": 1.3581520318984985, "learning_rate": 0.0001167324387694658, "loss": 1.9742725372314454, "memory(GiB)": 105.37, "step": 1615, "token_acc": 0.5531161473087819, "train_speed(iter/s)": 0.211476 }, { "epoch": 0.6240369799691834, "grad_norm": 0.93679279088974, "learning_rate": 0.00011666635514496293, "loss": 1.9857772827148437, "memory(GiB)": 105.37, "step": 1620, "token_acc": 0.5602997955939132, "train_speed(iter/s)": 0.211022 }, { "epoch": 0.6259630200308166, "grad_norm": 3.6678130626678467, "learning_rate": 0.00011660002732333324, "loss": 1.8675865173339843, "memory(GiB)": 105.37, "step": 1625, "token_acc": 0.5812195121951219, "train_speed(iter/s)": 0.211395 }, { "epoch": 0.6278890600924499, "grad_norm": 0.9907599687576294, "learning_rate": 0.00011653345560360116, "loss": 1.9520898818969727, "memory(GiB)": 105.37, "step": 1630, "token_acc": 0.5672423830778187, "train_speed(iter/s)": 0.211755 }, { "epoch": 0.6298151001540832, "grad_norm": 3.788294553756714, "learning_rate": 0.00011646664028589062, "loss": 1.9705934524536133, "memory(GiB)": 105.37, "step": 1635, "token_acc": 0.5625909752547307, "train_speed(iter/s)": 0.211495 }, { "epoch": 0.6317411402157165, "grad_norm": 2.0680153369903564, "learning_rate": 0.00011639958167142393, "loss": 1.9400318145751954, "memory(GiB)": 105.37, "step": 1640, "token_acc": 0.5583639705882353, "train_speed(iter/s)": 0.211853 }, { "epoch": 0.6336671802773498, "grad_norm": 1.4715518951416016, "learning_rate": 0.00011633228006252003, "loss": 2.005782890319824, "memory(GiB)": 105.37, "step": 1645, "token_acc": 0.5499254843517138, "train_speed(iter/s)": 0.211605 }, { "epoch": 0.635593220338983, "grad_norm": 0.8797225952148438, "learning_rate": 0.00011626473576259352, "loss": 1.9657068252563477, "memory(GiB)": 105.37, "step": 1650, "token_acc": 0.5540720961281709, "train_speed(iter/s)": 0.211752 }, { "epoch": 0.6375192604006163, "grad_norm": 0.9937166571617126, "learning_rate": 0.00011619694907615306, "loss": 2.0197063446044923, "memory(GiB)": 105.37, "step": 1655, "token_acc": 0.5500343485230135, "train_speed(iter/s)": 0.211583 }, { "epoch": 0.6394453004622496, "grad_norm": 1.6290827989578247, "learning_rate": 0.0001161289203088, "loss": 1.9664806365966796, "memory(GiB)": 105.37, "step": 1660, "token_acc": 0.5611902766135792, "train_speed(iter/s)": 0.21194 }, { "epoch": 0.6413713405238829, "grad_norm": 1.0984126329421997, "learning_rate": 0.00011606064976722716, "loss": 1.8735197067260743, "memory(GiB)": 105.37, "step": 1665, "token_acc": 0.55747738158595, "train_speed(iter/s)": 0.211974 }, { "epoch": 0.6432973805855162, "grad_norm": 1.7317132949829102, "learning_rate": 0.00011599213775921727, "loss": 1.9549205780029297, "memory(GiB)": 105.37, "step": 1670, "token_acc": 0.5516175561508345, "train_speed(iter/s)": 0.212033 }, { "epoch": 0.6452234206471494, "grad_norm": 0.7286852598190308, "learning_rate": 0.00011592338459364169, "loss": 1.9672489166259766, "memory(GiB)": 105.37, "step": 1675, "token_acc": 0.5603715170278638, "train_speed(iter/s)": 0.211845 }, { "epoch": 0.6471494607087828, "grad_norm": 1.5284219980239868, "learning_rate": 0.00011585439058045899, "loss": 1.9658515930175782, "memory(GiB)": 105.37, "step": 1680, "token_acc": 0.5352622061482821, "train_speed(iter/s)": 0.21203 }, { "epoch": 0.649075500770416, "grad_norm": 0.8596996665000916, "learning_rate": 0.00011578515603071351, "loss": 2.0247236251831056, "memory(GiB)": 105.37, "step": 1685, "token_acc": 0.553953488372093, "train_speed(iter/s)": 0.212382 }, { "epoch": 0.6510015408320493, "grad_norm": 0.961242139339447, "learning_rate": 0.0001157156812565341, "loss": 1.9505401611328126, "memory(GiB)": 105.37, "step": 1690, "token_acc": 0.5696594427244582, "train_speed(iter/s)": 0.212116 }, { "epoch": 0.6529275808936826, "grad_norm": 0.9511796236038208, "learning_rate": 0.00011564596657113244, "loss": 1.9510066986083985, "memory(GiB)": 105.37, "step": 1695, "token_acc": 0.5694721825962911, "train_speed(iter/s)": 0.212262 }, { "epoch": 0.6548536209553159, "grad_norm": 0.7844828367233276, "learning_rate": 0.00011557601228880197, "loss": 1.9544694900512696, "memory(GiB)": 105.37, "step": 1700, "token_acc": 0.5549969837120451, "train_speed(iter/s)": 0.21194 }, { "epoch": 0.6567796610169492, "grad_norm": 0.8266842365264893, "learning_rate": 0.00011550581872491616, "loss": 1.987652587890625, "memory(GiB)": 105.37, "step": 1705, "token_acc": 0.5577815783044222, "train_speed(iter/s)": 0.212133 }, { "epoch": 0.6587057010785824, "grad_norm": 2.105344533920288, "learning_rate": 0.00011543538619592734, "loss": 1.9719772338867188, "memory(GiB)": 105.37, "step": 1710, "token_acc": 0.5512418615866892, "train_speed(iter/s)": 0.212208 }, { "epoch": 0.6606317411402157, "grad_norm": 0.9168369174003601, "learning_rate": 0.00011536471501936508, "loss": 1.991562843322754, "memory(GiB)": 105.37, "step": 1715, "token_acc": 0.5696920583468396, "train_speed(iter/s)": 0.21211 }, { "epoch": 0.662557781201849, "grad_norm": 1.1968766450881958, "learning_rate": 0.0001152938055138349, "loss": 1.9249608993530274, "memory(GiB)": 105.37, "step": 1720, "token_acc": 0.5806552262090484, "train_speed(iter/s)": 0.212463 }, { "epoch": 0.6644838212634823, "grad_norm": 1.224352240562439, "learning_rate": 0.00011522265799901671, "loss": 1.9515010833740234, "memory(GiB)": 105.37, "step": 1725, "token_acc": 0.560291519434629, "train_speed(iter/s)": 0.212644 }, { "epoch": 0.6664098613251156, "grad_norm": 0.9242827892303467, "learning_rate": 0.00011515127279566351, "loss": 1.945500373840332, "memory(GiB)": 105.37, "step": 1730, "token_acc": 0.5604420907207, "train_speed(iter/s)": 0.212406 }, { "epoch": 0.6683359013867488, "grad_norm": 0.9901937246322632, "learning_rate": 0.00011507965022559979, "loss": 1.950948143005371, "memory(GiB)": 105.37, "step": 1735, "token_acc": 0.549146110056926, "train_speed(iter/s)": 0.212583 }, { "epoch": 0.6702619414483821, "grad_norm": 0.8866608142852783, "learning_rate": 0.00011500779061172023, "loss": 1.9757640838623047, "memory(GiB)": 105.37, "step": 1740, "token_acc": 0.5787269681742043, "train_speed(iter/s)": 0.212321 }, { "epoch": 0.6721879815100154, "grad_norm": 1.0115567445755005, "learning_rate": 0.00011493569427798808, "loss": 1.9596431732177735, "memory(GiB)": 105.37, "step": 1745, "token_acc": 0.5777520278099653, "train_speed(iter/s)": 0.212435 }, { "epoch": 0.6741140215716487, "grad_norm": 1.4893888235092163, "learning_rate": 0.00011486336154943389, "loss": 1.9281715393066405, "memory(GiB)": 105.37, "step": 1750, "token_acc": 0.556639796351294, "train_speed(iter/s)": 0.212653 }, { "epoch": 0.676040061633282, "grad_norm": 4.177835464477539, "learning_rate": 0.00011479079275215387, "loss": 1.9544342041015625, "memory(GiB)": 105.37, "step": 1755, "token_acc": 0.5617792421746294, "train_speed(iter/s)": 0.212439 }, { "epoch": 0.6779661016949152, "grad_norm": 1.4126033782958984, "learning_rate": 0.00011471798821330853, "loss": 1.9356151580810548, "memory(GiB)": 105.37, "step": 1760, "token_acc": 0.5651345558466302, "train_speed(iter/s)": 0.212543 }, { "epoch": 0.6798921417565486, "grad_norm": 1.016875982284546, "learning_rate": 0.00011464494826112115, "loss": 1.8886493682861327, "memory(GiB)": 105.37, "step": 1765, "token_acc": 0.5927835051546392, "train_speed(iter/s)": 0.212231 }, { "epoch": 0.6818181818181818, "grad_norm": 1.1616668701171875, "learning_rate": 0.00011457167322487633, "loss": 1.9562149047851562, "memory(GiB)": 105.37, "step": 1770, "token_acc": 0.5639546858908342, "train_speed(iter/s)": 0.212103 }, { "epoch": 0.6837442218798151, "grad_norm": 1.2536641359329224, "learning_rate": 0.0001144981634349185, "loss": 1.9360809326171875, "memory(GiB)": 105.37, "step": 1775, "token_acc": 0.5799671592775041, "train_speed(iter/s)": 0.212159 }, { "epoch": 0.6856702619414484, "grad_norm": 0.7041999101638794, "learning_rate": 0.0001144244192226504, "loss": 1.9445245742797852, "memory(GiB)": 105.37, "step": 1780, "token_acc": 0.5462128043282236, "train_speed(iter/s)": 0.212495 }, { "epoch": 0.6875963020030816, "grad_norm": 0.8610641360282898, "learning_rate": 0.00011435044092053165, "loss": 1.9702924728393554, "memory(GiB)": 105.37, "step": 1785, "token_acc": 0.563499245852187, "train_speed(iter/s)": 0.212805 }, { "epoch": 0.689522342064715, "grad_norm": 0.6737650036811829, "learning_rate": 0.00011427622886207719, "loss": 1.915751075744629, "memory(GiB)": 105.37, "step": 1790, "token_acc": 0.5678795483061481, "train_speed(iter/s)": 0.212328 }, { "epoch": 0.6914483821263482, "grad_norm": 0.7427929043769836, "learning_rate": 0.00011420178338185578, "loss": 2.0041549682617186, "memory(GiB)": 105.37, "step": 1795, "token_acc": 0.5318739475583354, "train_speed(iter/s)": 0.212596 }, { "epoch": 0.6933744221879815, "grad_norm": 0.7349951863288879, "learning_rate": 0.00011412710481548855, "loss": 1.9224048614501954, "memory(GiB)": 105.37, "step": 1800, "token_acc": 0.5747244296334273, "train_speed(iter/s)": 0.212287 }, { "epoch": 0.6953004622496148, "grad_norm": 0.7216867804527283, "learning_rate": 0.00011405219349964744, "loss": 1.9310737609863282, "memory(GiB)": 105.37, "step": 1805, "token_acc": 0.5662983425414365, "train_speed(iter/s)": 0.212618 }, { "epoch": 0.697226502311248, "grad_norm": 1.2759655714035034, "learning_rate": 0.00011397704977205368, "loss": 1.981161117553711, "memory(GiB)": 105.37, "step": 1810, "token_acc": 0.5637583892617449, "train_speed(iter/s)": 0.212912 }, { "epoch": 0.6991525423728814, "grad_norm": 0.7700905203819275, "learning_rate": 0.00011390167397147625, "loss": 1.9500804901123048, "memory(GiB)": 105.37, "step": 1815, "token_acc": 0.569050832208727, "train_speed(iter/s)": 0.21275 }, { "epoch": 0.7010785824345146, "grad_norm": 1.0271632671356201, "learning_rate": 0.00011382606643773042, "loss": 1.8470108032226562, "memory(GiB)": 105.37, "step": 1820, "token_acc": 0.5817095349441413, "train_speed(iter/s)": 0.212627 }, { "epoch": 0.7030046224961479, "grad_norm": 1.4572709798812866, "learning_rate": 0.00011375022751167618, "loss": 1.9281013488769532, "memory(GiB)": 105.37, "step": 1825, "token_acc": 0.5912471395881007, "train_speed(iter/s)": 0.212534 }, { "epoch": 0.7049306625577813, "grad_norm": 0.8261297941207886, "learning_rate": 0.00011367415753521668, "loss": 1.923367691040039, "memory(GiB)": 105.37, "step": 1830, "token_acc": 0.566397487662629, "train_speed(iter/s)": 0.21255 }, { "epoch": 0.7068567026194145, "grad_norm": 0.931074321269989, "learning_rate": 0.00011359785685129669, "loss": 1.9254417419433594, "memory(GiB)": 105.37, "step": 1835, "token_acc": 0.5726230291447683, "train_speed(iter/s)": 0.211973 }, { "epoch": 0.7087827426810478, "grad_norm": 1.3759779930114746, "learning_rate": 0.00011352132580390116, "loss": 1.9928672790527344, "memory(GiB)": 105.37, "step": 1840, "token_acc": 0.5512025787255145, "train_speed(iter/s)": 0.212293 }, { "epoch": 0.710708782742681, "grad_norm": 0.9524219036102295, "learning_rate": 0.00011344456473805347, "loss": 1.968313217163086, "memory(GiB)": 105.37, "step": 1845, "token_acc": 0.5519356075124568, "train_speed(iter/s)": 0.21254 }, { "epoch": 0.7126348228043143, "grad_norm": 1.4314206838607788, "learning_rate": 0.00011336757399981408, "loss": 1.958421516418457, "memory(GiB)": 105.37, "step": 1850, "token_acc": 0.554814506044185, "train_speed(iter/s)": 0.212073 }, { "epoch": 0.7145608628659477, "grad_norm": 1.0286951065063477, "learning_rate": 0.00011329035393627881, "loss": 1.9496952056884767, "memory(GiB)": 105.37, "step": 1855, "token_acc": 0.5602315742596303, "train_speed(iter/s)": 0.212393 }, { "epoch": 0.7164869029275809, "grad_norm": 0.8791049718856812, "learning_rate": 0.0001132129048955774, "loss": 1.8760465621948241, "memory(GiB)": 105.37, "step": 1860, "token_acc": 0.5608375778155065, "train_speed(iter/s)": 0.212071 }, { "epoch": 0.7184129429892142, "grad_norm": 0.8164251446723938, "learning_rate": 0.00011313522722687183, "loss": 1.9845855712890625, "memory(GiB)": 105.37, "step": 1865, "token_acc": 0.5581208053691276, "train_speed(iter/s)": 0.212399 }, { "epoch": 0.7203389830508474, "grad_norm": 19.95476531982422, "learning_rate": 0.00011305732128035484, "loss": 1.9429607391357422, "memory(GiB)": 105.37, "step": 1870, "token_acc": 0.5788177339901478, "train_speed(iter/s)": 0.212724 }, { "epoch": 0.7222650231124808, "grad_norm": 1.211210012435913, "learning_rate": 0.00011297918740724829, "loss": 1.9235092163085938, "memory(GiB)": 105.37, "step": 1875, "token_acc": 0.5666144200626959, "train_speed(iter/s)": 0.212378 }, { "epoch": 0.724191063174114, "grad_norm": 1.090421438217163, "learning_rate": 0.00011290082595980162, "loss": 1.9440628051757813, "memory(GiB)": 105.37, "step": 1880, "token_acc": 0.5681221665473634, "train_speed(iter/s)": 0.212686 }, { "epoch": 0.7261171032357473, "grad_norm": 8.611966133117676, "learning_rate": 0.00011282223729129019, "loss": 1.8945022583007813, "memory(GiB)": 105.37, "step": 1885, "token_acc": 0.5661334373780725, "train_speed(iter/s)": 0.21238 }, { "epoch": 0.7280431432973806, "grad_norm": 0.7944480180740356, "learning_rate": 0.00011274342175601377, "loss": 1.893497848510742, "memory(GiB)": 105.37, "step": 1890, "token_acc": 0.5713922764227642, "train_speed(iter/s)": 0.212687 }, { "epoch": 0.7299691833590138, "grad_norm": 1.341949462890625, "learning_rate": 0.00011266437970929494, "loss": 1.940311813354492, "memory(GiB)": 105.37, "step": 1895, "token_acc": 0.5615449915110357, "train_speed(iter/s)": 0.212159 }, { "epoch": 0.7318952234206472, "grad_norm": 1.541922688484192, "learning_rate": 0.0001125851115074774, "loss": 1.9760021209716796, "memory(GiB)": 105.37, "step": 1900, "token_acc": 0.5640750670241287, "train_speed(iter/s)": 0.212474 }, { "epoch": 0.7338212634822804, "grad_norm": 0.9927903413772583, "learning_rate": 0.00011250561750792444, "loss": 1.874945831298828, "memory(GiB)": 105.37, "step": 1905, "token_acc": 0.5641406636948985, "train_speed(iter/s)": 0.212788 }, { "epoch": 0.7357473035439137, "grad_norm": 1.0107380151748657, "learning_rate": 0.00011242589806901734, "loss": 1.893092155456543, "memory(GiB)": 105.37, "step": 1910, "token_acc": 0.5681997371879106, "train_speed(iter/s)": 0.212372 }, { "epoch": 0.737673343605547, "grad_norm": 0.9208437204360962, "learning_rate": 0.00011234595355015367, "loss": 1.9173364639282227, "memory(GiB)": 105.37, "step": 1915, "token_acc": 0.5478199718706048, "train_speed(iter/s)": 0.21269 }, { "epoch": 0.7395993836671803, "grad_norm": 1.238067865371704, "learning_rate": 0.00011226578431174578, "loss": 1.9457626342773438, "memory(GiB)": 105.37, "step": 1920, "token_acc": 0.5769338173694498, "train_speed(iter/s)": 0.212353 }, { "epoch": 0.7415254237288136, "grad_norm": 1.0721635818481445, "learning_rate": 0.00011218539071521905, "loss": 1.8595882415771485, "memory(GiB)": 105.37, "step": 1925, "token_acc": 0.5843278540869173, "train_speed(iter/s)": 0.212665 }, { "epoch": 0.7434514637904468, "grad_norm": 1.2257107496261597, "learning_rate": 0.00011210477312301042, "loss": 1.945622444152832, "memory(GiB)": 105.37, "step": 1930, "token_acc": 0.5687169629985583, "train_speed(iter/s)": 0.212976 }, { "epoch": 0.7453775038520801, "grad_norm": 0.7899504899978638, "learning_rate": 0.00011202393189856658, "loss": 1.9221580505371094, "memory(GiB)": 105.37, "step": 1935, "token_acc": 0.5593146822815007, "train_speed(iter/s)": 0.212436 }, { "epoch": 0.7473035439137135, "grad_norm": 1.225388765335083, "learning_rate": 0.00011194286740634245, "loss": 1.9105697631835938, "memory(GiB)": 105.37, "step": 1940, "token_acc": 0.5761794276875484, "train_speed(iter/s)": 0.212746 }, { "epoch": 0.7492295839753467, "grad_norm": 0.8033237457275391, "learning_rate": 0.00011186158001179953, "loss": 1.8814922332763673, "memory(GiB)": 105.37, "step": 1945, "token_acc": 0.5732989911998283, "train_speed(iter/s)": 0.212331 }, { "epoch": 0.75115562403698, "grad_norm": 0.9364333152770996, "learning_rate": 0.00011178007008140417, "loss": 1.9186790466308594, "memory(GiB)": 105.37, "step": 1950, "token_acc": 0.555024962014326, "train_speed(iter/s)": 0.21264 }, { "epoch": 0.7530816640986132, "grad_norm": 1.0878405570983887, "learning_rate": 0.00011169833798262604, "loss": 1.9157623291015624, "memory(GiB)": 105.37, "step": 1955, "token_acc": 0.5661790938280414, "train_speed(iter/s)": 0.212411 }, { "epoch": 0.7550077041602465, "grad_norm": 0.8569443225860596, "learning_rate": 0.00011161638408393635, "loss": 1.9059930801391602, "memory(GiB)": 105.37, "step": 1960, "token_acc": 0.5630813953488372, "train_speed(iter/s)": 0.212724 }, { "epoch": 0.7569337442218799, "grad_norm": 0.8677403926849365, "learning_rate": 0.00011153420875480627, "loss": 1.901895523071289, "memory(GiB)": 105.37, "step": 1965, "token_acc": 0.5575289575289575, "train_speed(iter/s)": 0.213032 }, { "epoch": 0.7588597842835131, "grad_norm": 0.8206605315208435, "learning_rate": 0.00011145181236570526, "loss": 1.95764102935791, "memory(GiB)": 105.37, "step": 1970, "token_acc": 0.554931640625, "train_speed(iter/s)": 0.212685 }, { "epoch": 0.7607858243451464, "grad_norm": 2.4774723052978516, "learning_rate": 0.00011136919528809936, "loss": 1.9139698028564454, "memory(GiB)": 105.37, "step": 1975, "token_acc": 0.5821572580645161, "train_speed(iter/s)": 0.212991 }, { "epoch": 0.7627118644067796, "grad_norm": 0.8873789310455322, "learning_rate": 0.0001112863578944495, "loss": 1.9036279678344727, "memory(GiB)": 105.37, "step": 1980, "token_acc": 0.5855191256830601, "train_speed(iter/s)": 0.212472 }, { "epoch": 0.764637904468413, "grad_norm": 0.8643931150436401, "learning_rate": 0.00011120330055820992, "loss": 1.9084108352661133, "memory(GiB)": 105.37, "step": 1985, "token_acc": 0.5609284332688588, "train_speed(iter/s)": 0.212777 }, { "epoch": 0.7665639445300462, "grad_norm": 1.2380619049072266, "learning_rate": 0.00011112002365382642, "loss": 1.901507568359375, "memory(GiB)": 105.37, "step": 1990, "token_acc": 0.5783442469597755, "train_speed(iter/s)": 0.213082 }, { "epoch": 0.7684899845916795, "grad_norm": 1.3662925958633423, "learning_rate": 0.0001110365275567346, "loss": 1.8699583053588866, "memory(GiB)": 105.37, "step": 1995, "token_acc": 0.5565415244596132, "train_speed(iter/s)": 0.212768 }, { "epoch": 0.7704160246533128, "grad_norm": 1.0294005870819092, "learning_rate": 0.00011095281264335833, "loss": 1.9061019897460938, "memory(GiB)": 105.37, "step": 2000, "token_acc": 0.551140544518028, "train_speed(iter/s)": 0.213069 }, { "epoch": 0.772342064714946, "grad_norm": 1.987120270729065, "learning_rate": 0.00011086887929110791, "loss": 1.9450611114501952, "memory(GiB)": 105.37, "step": 2005, "token_acc": 0.555, "train_speed(iter/s)": 0.211114 }, { "epoch": 0.7742681047765794, "grad_norm": 1.4287042617797852, "learning_rate": 0.00011078472787837844, "loss": 1.9300682067871093, "memory(GiB)": 105.37, "step": 2010, "token_acc": 0.5772629567709577, "train_speed(iter/s)": 0.211419 }, { "epoch": 0.7761941448382126, "grad_norm": 1.0672380924224854, "learning_rate": 0.00011070035878454811, "loss": 1.9267253875732422, "memory(GiB)": 105.37, "step": 2015, "token_acc": 0.5817198177676538, "train_speed(iter/s)": 0.211715 }, { "epoch": 0.7781201848998459, "grad_norm": 0.7847228050231934, "learning_rate": 0.00011061577238997646, "loss": 1.9650281906127929, "memory(GiB)": 105.37, "step": 2020, "token_acc": 0.5662796323173682, "train_speed(iter/s)": 0.211848 }, { "epoch": 0.7800462249614792, "grad_norm": 1.0664207935333252, "learning_rate": 0.0001105309690760027, "loss": 1.9179840087890625, "memory(GiB)": 105.37, "step": 2025, "token_acc": 0.554618213281419, "train_speed(iter/s)": 0.212148 }, { "epoch": 0.7819722650231125, "grad_norm": 0.8073892593383789, "learning_rate": 0.00011044594922494394, "loss": 1.9462203979492188, "memory(GiB)": 105.37, "step": 2030, "token_acc": 0.5680738786279683, "train_speed(iter/s)": 0.211927 }, { "epoch": 0.7838983050847458, "grad_norm": 0.8676369190216064, "learning_rate": 0.00011036071322009356, "loss": 1.9499420166015624, "memory(GiB)": 105.37, "step": 2035, "token_acc": 0.5589616810877627, "train_speed(iter/s)": 0.212221 }, { "epoch": 0.785824345146379, "grad_norm": 1.7634555101394653, "learning_rate": 0.00011027526144571935, "loss": 1.894424057006836, "memory(GiB)": 105.37, "step": 2040, "token_acc": 0.574585635359116, "train_speed(iter/s)": 0.211689 }, { "epoch": 0.7877503852080123, "grad_norm": 1.019718050956726, "learning_rate": 0.0001101895942870619, "loss": 1.934789276123047, "memory(GiB)": 105.37, "step": 2045, "token_acc": 0.5721692243882207, "train_speed(iter/s)": 0.211983 }, { "epoch": 0.7896764252696457, "grad_norm": 1.0537678003311157, "learning_rate": 0.00011010371213033281, "loss": 1.9338647842407226, "memory(GiB)": 105.37, "step": 2050, "token_acc": 0.5722924683892249, "train_speed(iter/s)": 0.21228 }, { "epoch": 0.7916024653312789, "grad_norm": 0.880235493183136, "learning_rate": 0.00011001761536271291, "loss": 1.9429962158203125, "memory(GiB)": 105.37, "step": 2055, "token_acc": 0.5754468209786112, "train_speed(iter/s)": 0.211759 }, { "epoch": 0.7935285053929122, "grad_norm": 1.0405648946762085, "learning_rate": 0.00010993130437235061, "loss": 1.8974205017089845, "memory(GiB)": 105.37, "step": 2060, "token_acc": 0.5553140621603999, "train_speed(iter/s)": 0.212051 }, { "epoch": 0.7954545454545454, "grad_norm": 1.0976312160491943, "learning_rate": 0.00010984477954836005, "loss": 1.8986242294311524, "memory(GiB)": 105.37, "step": 2065, "token_acc": 0.5683109797681292, "train_speed(iter/s)": 0.211509 }, { "epoch": 0.7973805855161787, "grad_norm": 0.735440194606781, "learning_rate": 0.00010975804128081944, "loss": 1.8711969375610351, "memory(GiB)": 105.37, "step": 2070, "token_acc": 0.5567129629629629, "train_speed(iter/s)": 0.211793 }, { "epoch": 0.7993066255778121, "grad_norm": 0.8371529579162598, "learning_rate": 0.00010967108996076922, "loss": 1.9112056732177733, "memory(GiB)": 105.37, "step": 2075, "token_acc": 0.5793629185951539, "train_speed(iter/s)": 0.212083 }, { "epoch": 0.8012326656394453, "grad_norm": 1.1095043420791626, "learning_rate": 0.0001095839259802103, "loss": 1.9394035339355469, "memory(GiB)": 105.37, "step": 2080, "token_acc": 0.557458426408538, "train_speed(iter/s)": 0.211717 }, { "epoch": 0.8031587057010786, "grad_norm": 1.0045527219772339, "learning_rate": 0.0001094965497321024, "loss": 1.9097469329833985, "memory(GiB)": 105.37, "step": 2085, "token_acc": 0.6036697247706422, "train_speed(iter/s)": 0.212009 }, { "epoch": 0.8050847457627118, "grad_norm": 1.7117685079574585, "learning_rate": 0.00010940896161036217, "loss": 1.9298751831054688, "memory(GiB)": 105.37, "step": 2090, "token_acc": 0.5724203218680972, "train_speed(iter/s)": 0.211707 }, { "epoch": 0.8070107858243452, "grad_norm": 1.063154697418213, "learning_rate": 0.00010932116200986142, "loss": 1.9341747283935546, "memory(GiB)": 105.37, "step": 2095, "token_acc": 0.5577822311289246, "train_speed(iter/s)": 0.211991 }, { "epoch": 0.8089368258859785, "grad_norm": 0.9046605229377747, "learning_rate": 0.00010923315132642537, "loss": 1.943634033203125, "memory(GiB)": 105.37, "step": 2100, "token_acc": 0.5559433779329067, "train_speed(iter/s)": 0.211745 }, { "epoch": 0.8108628659476117, "grad_norm": 0.9120232462882996, "learning_rate": 0.0001091449299568309, "loss": 1.8745365142822266, "memory(GiB)": 105.37, "step": 2105, "token_acc": 0.5791666666666667, "train_speed(iter/s)": 0.212024 }, { "epoch": 0.812788906009245, "grad_norm": 0.8366382718086243, "learning_rate": 0.00010905649829880466, "loss": 1.909491729736328, "memory(GiB)": 105.37, "step": 2110, "token_acc": 0.5692370627940274, "train_speed(iter/s)": 0.212307 }, { "epoch": 0.8147149460708782, "grad_norm": 2.30214262008667, "learning_rate": 0.00010896785675102143, "loss": 1.932793426513672, "memory(GiB)": 105.37, "step": 2115, "token_acc": 0.5724747474747475, "train_speed(iter/s)": 0.211878 }, { "epoch": 0.8166409861325116, "grad_norm": 1.1005938053131104, "learning_rate": 0.00010887900571310214, "loss": 1.9067310333251952, "memory(GiB)": 105.37, "step": 2120, "token_acc": 0.5668124392614189, "train_speed(iter/s)": 0.212158 }, { "epoch": 0.8185670261941448, "grad_norm": 1.9612469673156738, "learning_rate": 0.00010878994558561222, "loss": 1.911146354675293, "memory(GiB)": 105.37, "step": 2125, "token_acc": 0.5768487191880135, "train_speed(iter/s)": 0.211852 }, { "epoch": 0.8204930662557781, "grad_norm": 0.9877184629440308, "learning_rate": 0.00010870067677005968, "loss": 1.922208023071289, "memory(GiB)": 105.37, "step": 2130, "token_acc": 0.554626334519573, "train_speed(iter/s)": 0.212133 }, { "epoch": 0.8224191063174114, "grad_norm": 0.9043750762939453, "learning_rate": 0.00010861119966889343, "loss": 1.8661931991577148, "memory(GiB)": 105.37, "step": 2135, "token_acc": 0.5730914997292907, "train_speed(iter/s)": 0.212403 }, { "epoch": 0.8243451463790447, "grad_norm": 1.2544159889221191, "learning_rate": 0.0001085215146855013, "loss": 1.9020450592041016, "memory(GiB)": 105.37, "step": 2140, "token_acc": 0.5564387917329093, "train_speed(iter/s)": 0.211996 }, { "epoch": 0.826271186440678, "grad_norm": 0.7074183225631714, "learning_rate": 0.00010843162222420842, "loss": 1.88577880859375, "memory(GiB)": 105.37, "step": 2145, "token_acc": 0.5868421052631579, "train_speed(iter/s)": 0.212275 }, { "epoch": 0.8281972265023112, "grad_norm": 1.2796639204025269, "learning_rate": 0.00010834152269027517, "loss": 1.9357921600341796, "memory(GiB)": 105.37, "step": 2150, "token_acc": 0.5649913344887348, "train_speed(iter/s)": 0.211886 }, { "epoch": 0.8301232665639445, "grad_norm": 0.906509280204773, "learning_rate": 0.00010825121648989555, "loss": 1.9292556762695312, "memory(GiB)": 105.37, "step": 2155, "token_acc": 0.56531152273274, "train_speed(iter/s)": 0.212161 }, { "epoch": 0.8320493066255779, "grad_norm": 1.2688450813293457, "learning_rate": 0.00010816070403019526, "loss": 1.9338062286376954, "memory(GiB)": 105.37, "step": 2160, "token_acc": 0.5687215765538151, "train_speed(iter/s)": 0.211663 }, { "epoch": 0.8339753466872111, "grad_norm": 0.7723739147186279, "learning_rate": 0.00010806998571922986, "loss": 1.9361949920654298, "memory(GiB)": 105.37, "step": 2165, "token_acc": 0.5645988805970149, "train_speed(iter/s)": 0.211939 }, { "epoch": 0.8359013867488444, "grad_norm": 0.8162662386894226, "learning_rate": 0.00010797906196598293, "loss": 1.8936233520507812, "memory(GiB)": 105.37, "step": 2170, "token_acc": 0.552744630071599, "train_speed(iter/s)": 0.212212 }, { "epoch": 0.8378274268104776, "grad_norm": 0.9353050589561462, "learning_rate": 0.00010788793318036427, "loss": 1.9554435729980468, "memory(GiB)": 105.37, "step": 2175, "token_acc": 0.5675565518646831, "train_speed(iter/s)": 0.211931 }, { "epoch": 0.8397534668721109, "grad_norm": 1.354371428489685, "learning_rate": 0.00010779659977320805, "loss": 1.9177799224853516, "memory(GiB)": 105.37, "step": 2180, "token_acc": 0.5776081424936387, "train_speed(iter/s)": 0.212212 }, { "epoch": 0.8416795069337443, "grad_norm": 0.8782749772071838, "learning_rate": 0.00010770506215627084, "loss": 1.892471694946289, "memory(GiB)": 105.37, "step": 2185, "token_acc": 0.5651615664455382, "train_speed(iter/s)": 0.211914 }, { "epoch": 0.8436055469953775, "grad_norm": 0.9687239527702332, "learning_rate": 0.00010761332074222994, "loss": 1.8565200805664062, "memory(GiB)": 105.37, "step": 2190, "token_acc": 0.5587207739854878, "train_speed(iter/s)": 0.212191 }, { "epoch": 0.8455315870570108, "grad_norm": 1.4167234897613525, "learning_rate": 0.00010752137594468134, "loss": 1.9247961044311523, "memory(GiB)": 105.37, "step": 2195, "token_acc": 0.5732398165632587, "train_speed(iter/s)": 0.21246 }, { "epoch": 0.847457627118644, "grad_norm": 0.8777409791946411, "learning_rate": 0.00010742922817813804, "loss": 1.8779016494750977, "memory(GiB)": 105.37, "step": 2200, "token_acc": 0.5757649344341913, "train_speed(iter/s)": 0.211995 }, { "epoch": 0.8493836671802774, "grad_norm": 0.9414359927177429, "learning_rate": 0.00010733687785802799, "loss": 1.8769182205200194, "memory(GiB)": 105.37, "step": 2205, "token_acc": 0.5672020287404903, "train_speed(iter/s)": 0.212269 }, { "epoch": 0.8513097072419107, "grad_norm": 1.0411300659179688, "learning_rate": 0.00010724432540069236, "loss": 1.9507434844970704, "memory(GiB)": 105.37, "step": 2210, "token_acc": 0.5724517906336088, "train_speed(iter/s)": 0.211956 }, { "epoch": 0.8532357473035439, "grad_norm": 0.8873267769813538, "learning_rate": 0.0001071515712233836, "loss": 1.9126800537109374, "memory(GiB)": 105.37, "step": 2215, "token_acc": 0.5796640944167045, "train_speed(iter/s)": 0.212227 }, { "epoch": 0.8551617873651772, "grad_norm": 0.7825678586959839, "learning_rate": 0.00010705861574426354, "loss": 1.9101314544677734, "memory(GiB)": 105.37, "step": 2220, "token_acc": 0.5633668101386896, "train_speed(iter/s)": 0.211816 }, { "epoch": 0.8570878274268104, "grad_norm": 0.8035494685173035, "learning_rate": 0.00010696545938240157, "loss": 1.8716983795166016, "memory(GiB)": 105.37, "step": 2225, "token_acc": 0.5648591174906964, "train_speed(iter/s)": 0.212082 }, { "epoch": 0.8590138674884438, "grad_norm": 1.0586990118026733, "learning_rate": 0.00010687210255777274, "loss": 1.9421785354614258, "memory(GiB)": 105.37, "step": 2230, "token_acc": 0.5647331786542923, "train_speed(iter/s)": 0.21235 }, { "epoch": 0.860939907550077, "grad_norm": 0.9601324200630188, "learning_rate": 0.00010677854569125579, "loss": 1.8767234802246093, "memory(GiB)": 105.37, "step": 2235, "token_acc": 0.5677059097254537, "train_speed(iter/s)": 0.212425 }, { "epoch": 0.8628659476117103, "grad_norm": 1.0070292949676514, "learning_rate": 0.00010668478920463129, "loss": 1.9305574417114257, "memory(GiB)": 105.37, "step": 2240, "token_acc": 0.5749811605124341, "train_speed(iter/s)": 0.212695 }, { "epoch": 0.8647919876733436, "grad_norm": 0.7341820597648621, "learning_rate": 0.00010659083352057982, "loss": 1.9255226135253907, "memory(GiB)": 105.37, "step": 2245, "token_acc": 0.5655053974484789, "train_speed(iter/s)": 0.212465 }, { "epoch": 0.8667180277349769, "grad_norm": 1.2573742866516113, "learning_rate": 0.00010649667906267998, "loss": 1.9455821990966797, "memory(GiB)": 105.37, "step": 2250, "token_acc": 0.558271056352252, "train_speed(iter/s)": 0.212725 }, { "epoch": 0.8686440677966102, "grad_norm": 1.0887494087219238, "learning_rate": 0.00010640232625540645, "loss": 1.894921875, "memory(GiB)": 105.37, "step": 2255, "token_acc": 0.5671087533156499, "train_speed(iter/s)": 0.212992 }, { "epoch": 0.8705701078582434, "grad_norm": 1.0962910652160645, "learning_rate": 0.00010630777552412818, "loss": 1.8874996185302735, "memory(GiB)": 105.37, "step": 2260, "token_acc": 0.5562913907284768, "train_speed(iter/s)": 0.212697 }, { "epoch": 0.8724961479198767, "grad_norm": 1.082460880279541, "learning_rate": 0.0001062130272951064, "loss": 1.8676143646240235, "memory(GiB)": 105.37, "step": 2265, "token_acc": 0.5758513931888545, "train_speed(iter/s)": 0.212961 }, { "epoch": 0.8744221879815101, "grad_norm": 1.1624494791030884, "learning_rate": 0.00010611808199549267, "loss": 1.8812053680419922, "memory(GiB)": 105.37, "step": 2270, "token_acc": 0.5735229759299781, "train_speed(iter/s)": 0.212641 }, { "epoch": 0.8763482280431433, "grad_norm": 0.8129061460494995, "learning_rate": 0.0001060229400533271, "loss": 1.9643457412719727, "memory(GiB)": 105.37, "step": 2275, "token_acc": 0.5657862854373638, "train_speed(iter/s)": 0.212903 }, { "epoch": 0.8782742681047766, "grad_norm": 1.6256614923477173, "learning_rate": 0.00010592760189753621, "loss": 1.918039894104004, "memory(GiB)": 105.37, "step": 2280, "token_acc": 0.5554035567715458, "train_speed(iter/s)": 0.212707 }, { "epoch": 0.8802003081664098, "grad_norm": 0.9473841786384583, "learning_rate": 0.00010583206795793119, "loss": 1.8533285140991211, "memory(GiB)": 105.37, "step": 2285, "token_acc": 0.5733795794493822, "train_speed(iter/s)": 0.212956 }, { "epoch": 0.8821263482280431, "grad_norm": 1.5509757995605469, "learning_rate": 0.00010573633866520582, "loss": 1.8473834991455078, "memory(GiB)": 105.37, "step": 2290, "token_acc": 0.5614803993182371, "train_speed(iter/s)": 0.213213 }, { "epoch": 0.8840523882896765, "grad_norm": 1.2025234699249268, "learning_rate": 0.00010564041445093464, "loss": 1.9006170272827148, "memory(GiB)": 105.37, "step": 2295, "token_acc": 0.5547520661157025, "train_speed(iter/s)": 0.212826 }, { "epoch": 0.8859784283513097, "grad_norm": 0.8838430047035217, "learning_rate": 0.00010554429574757087, "loss": 1.9109169006347657, "memory(GiB)": 105.37, "step": 2300, "token_acc": 0.5698838606327593, "train_speed(iter/s)": 0.213085 }, { "epoch": 0.887904468412943, "grad_norm": 1.3309389352798462, "learning_rate": 0.00010544798298844465, "loss": 1.9207313537597657, "memory(GiB)": 105.37, "step": 2305, "token_acc": 0.5609756097560976, "train_speed(iter/s)": 0.212598 }, { "epoch": 0.8898305084745762, "grad_norm": 0.9611072540283203, "learning_rate": 0.0001053514766077609, "loss": 1.8312957763671875, "memory(GiB)": 105.37, "step": 2310, "token_acc": 0.5659125188536953, "train_speed(iter/s)": 0.212855 }, { "epoch": 0.8917565485362096, "grad_norm": 0.8508879542350769, "learning_rate": 0.00010525477704059745, "loss": 1.86734619140625, "memory(GiB)": 105.37, "step": 2315, "token_acc": 0.5711055844449469, "train_speed(iter/s)": 0.212505 }, { "epoch": 0.8936825885978429, "grad_norm": 0.6272566318511963, "learning_rate": 0.00010515788472290309, "loss": 1.8701967239379882, "memory(GiB)": 105.37, "step": 2320, "token_acc": 0.5673699603091706, "train_speed(iter/s)": 0.212656 }, { "epoch": 0.8956086286594761, "grad_norm": 1.245864987373352, "learning_rate": 0.00010506080009149558, "loss": 1.8950122833251952, "memory(GiB)": 105.37, "step": 2325, "token_acc": 0.5716608594657375, "train_speed(iter/s)": 0.21277 }, { "epoch": 0.8975346687211094, "grad_norm": 0.8120641112327576, "learning_rate": 0.00010496352358405967, "loss": 1.8934310913085937, "memory(GiB)": 105.37, "step": 2330, "token_acc": 0.5543902439024391, "train_speed(iter/s)": 0.2125 }, { "epoch": 0.8994607087827426, "grad_norm": 1.410618782043457, "learning_rate": 0.00010486605563914516, "loss": 1.9373258590698241, "memory(GiB)": 105.37, "step": 2335, "token_acc": 0.5496739547372459, "train_speed(iter/s)": 0.212755 }, { "epoch": 0.901386748844376, "grad_norm": 1.2583314180374146, "learning_rate": 0.00010476839669616486, "loss": 1.8911588668823243, "memory(GiB)": 105.37, "step": 2340, "token_acc": 0.5606508875739645, "train_speed(iter/s)": 0.212218 }, { "epoch": 0.9033127889060092, "grad_norm": 0.8492756485939026, "learning_rate": 0.00010467054719539273, "loss": 1.8848827362060547, "memory(GiB)": 105.37, "step": 2345, "token_acc": 0.5775429326287979, "train_speed(iter/s)": 0.212472 }, { "epoch": 0.9052388289676425, "grad_norm": 1.1416641473770142, "learning_rate": 0.00010457250757796175, "loss": 1.8898639678955078, "memory(GiB)": 105.37, "step": 2350, "token_acc": 0.5818945403639757, "train_speed(iter/s)": 0.21273 }, { "epoch": 0.9071648690292758, "grad_norm": 1.9363975524902344, "learning_rate": 0.00010447427828586202, "loss": 1.8919353485107422, "memory(GiB)": 105.37, "step": 2355, "token_acc": 0.571497005988024, "train_speed(iter/s)": 0.212447 }, { "epoch": 0.9090909090909091, "grad_norm": 0.7731749415397644, "learning_rate": 0.00010437585976193878, "loss": 1.883367919921875, "memory(GiB)": 105.37, "step": 2360, "token_acc": 0.5764480408858603, "train_speed(iter/s)": 0.212691 }, { "epoch": 0.9110169491525424, "grad_norm": 0.9075607657432556, "learning_rate": 0.00010427725244989029, "loss": 1.8688194274902343, "memory(GiB)": 105.37, "step": 2365, "token_acc": 0.5617529880478087, "train_speed(iter/s)": 0.212255 }, { "epoch": 0.9129429892141756, "grad_norm": 1.7208845615386963, "learning_rate": 0.00010417845679426605, "loss": 1.8929000854492188, "memory(GiB)": 105.37, "step": 2370, "token_acc": 0.5695077484047402, "train_speed(iter/s)": 0.212508 }, { "epoch": 0.9148690292758089, "grad_norm": 1.597895860671997, "learning_rate": 0.00010407947324046453, "loss": 1.846609115600586, "memory(GiB)": 105.37, "step": 2375, "token_acc": 0.5782608695652174, "train_speed(iter/s)": 0.212275 }, { "epoch": 0.9167950693374423, "grad_norm": 1.5805600881576538, "learning_rate": 0.00010398030223473143, "loss": 1.8697330474853515, "memory(GiB)": 105.37, "step": 2380, "token_acc": 0.5650087260034904, "train_speed(iter/s)": 0.21237 }, { "epoch": 0.9187211093990755, "grad_norm": 0.9898545145988464, "learning_rate": 0.0001038809442241574, "loss": 1.9131847381591798, "memory(GiB)": 105.37, "step": 2385, "token_acc": 0.5714651639344263, "train_speed(iter/s)": 0.212544 }, { "epoch": 0.9206471494607088, "grad_norm": 0.8661528825759888, "learning_rate": 0.00010378139965667628, "loss": 1.8387161254882813, "memory(GiB)": 105.37, "step": 2390, "token_acc": 0.5752688172043011, "train_speed(iter/s)": 0.21226 }, { "epoch": 0.922573189522342, "grad_norm": 0.797809898853302, "learning_rate": 0.00010368166898106287, "loss": 1.9009563446044921, "memory(GiB)": 105.37, "step": 2395, "token_acc": 0.5559462254395037, "train_speed(iter/s)": 0.212486 }, { "epoch": 0.9244992295839753, "grad_norm": 0.9048339128494263, "learning_rate": 0.00010358175264693109, "loss": 1.8808311462402343, "memory(GiB)": 105.37, "step": 2400, "token_acc": 0.548618219037871, "train_speed(iter/s)": 0.21212 }, { "epoch": 0.9264252696456087, "grad_norm": 0.7007138729095459, "learning_rate": 0.00010348165110473178, "loss": 1.8868871688842774, "memory(GiB)": 105.37, "step": 2405, "token_acc": 0.5656154628687691, "train_speed(iter/s)": 0.2122 }, { "epoch": 0.9283513097072419, "grad_norm": 0.8757054209709167, "learning_rate": 0.00010338136480575076, "loss": 1.9127147674560547, "memory(GiB)": 105.37, "step": 2410, "token_acc": 0.583402489626556, "train_speed(iter/s)": 0.212415 }, { "epoch": 0.9302773497688752, "grad_norm": 1.1285896301269531, "learning_rate": 0.00010328089420210684, "loss": 1.8715789794921875, "memory(GiB)": 105.37, "step": 2415, "token_acc": 0.5731398295323659, "train_speed(iter/s)": 0.212224 }, { "epoch": 0.9322033898305084, "grad_norm": 0.9764662981033325, "learning_rate": 0.00010318023974674965, "loss": 1.8707473754882813, "memory(GiB)": 105.37, "step": 2420, "token_acc": 0.5676027041081644, "train_speed(iter/s)": 0.212157 }, { "epoch": 0.9341294298921418, "grad_norm": 2.468919038772583, "learning_rate": 0.00010307940189345774, "loss": 1.9460697174072266, "memory(GiB)": 105.37, "step": 2425, "token_acc": 0.5766272189349112, "train_speed(iter/s)": 0.211966 }, { "epoch": 0.9360554699537751, "grad_norm": 0.828601598739624, "learning_rate": 0.00010297838109683646, "loss": 1.8588157653808595, "memory(GiB)": 105.37, "step": 2430, "token_acc": 0.5899778516057586, "train_speed(iter/s)": 0.211938 }, { "epoch": 0.9379815100154083, "grad_norm": 0.7998688220977783, "learning_rate": 0.0001028771778123159, "loss": 1.8905961990356446, "memory(GiB)": 105.37, "step": 2435, "token_acc": 0.566873339238264, "train_speed(iter/s)": 0.211865 }, { "epoch": 0.9399075500770416, "grad_norm": 1.2160381078720093, "learning_rate": 0.00010277579249614883, "loss": 1.9105518341064454, "memory(GiB)": 105.37, "step": 2440, "token_acc": 0.5792669702884407, "train_speed(iter/s)": 0.212108 }, { "epoch": 0.9418335901386748, "grad_norm": 1.2896326780319214, "learning_rate": 0.0001026742256054087, "loss": 1.9445823669433593, "memory(GiB)": 105.37, "step": 2445, "token_acc": 0.5425305688463583, "train_speed(iter/s)": 0.212147 }, { "epoch": 0.9437596302003082, "grad_norm": 1.93269944190979, "learning_rate": 0.0001025724775979876, "loss": 1.898458480834961, "memory(GiB)": 105.37, "step": 2450, "token_acc": 0.5846387064173825, "train_speed(iter/s)": 0.211977 }, { "epoch": 0.9456856702619415, "grad_norm": 0.7103263735771179, "learning_rate": 0.00010247054893259408, "loss": 1.9032676696777344, "memory(GiB)": 105.37, "step": 2455, "token_acc": 0.5615275813295615, "train_speed(iter/s)": 0.212075 }, { "epoch": 0.9476117103235747, "grad_norm": 1.6064002513885498, "learning_rate": 0.00010236844006875114, "loss": 1.8416248321533204, "memory(GiB)": 105.37, "step": 2460, "token_acc": 0.5761274306992139, "train_speed(iter/s)": 0.211906 }, { "epoch": 0.949537750385208, "grad_norm": 1.1327142715454102, "learning_rate": 0.00010226615146679418, "loss": 1.884109115600586, "memory(GiB)": 105.37, "step": 2465, "token_acc": 0.565477462080752, "train_speed(iter/s)": 0.212087 }, { "epoch": 0.9514637904468413, "grad_norm": 0.8920122981071472, "learning_rate": 0.00010216368358786897, "loss": 1.957171630859375, "memory(GiB)": 105.37, "step": 2470, "token_acc": 0.5472296802538443, "train_speed(iter/s)": 0.212327 }, { "epoch": 0.9533898305084746, "grad_norm": 1.9198769330978394, "learning_rate": 0.00010206103689392941, "loss": 1.8792835235595704, "memory(GiB)": 105.37, "step": 2475, "token_acc": 0.5587679005674142, "train_speed(iter/s)": 0.212011 }, { "epoch": 0.9553158705701078, "grad_norm": 1.4284560680389404, "learning_rate": 0.00010195821184773563, "loss": 1.8531095504760742, "memory(GiB)": 105.37, "step": 2480, "token_acc": 0.5927850810149802, "train_speed(iter/s)": 0.212255 }, { "epoch": 0.9572419106317411, "grad_norm": 0.8060047030448914, "learning_rate": 0.00010185520891285175, "loss": 1.9149555206298827, "memory(GiB)": 105.37, "step": 2485, "token_acc": 0.5785272914521112, "train_speed(iter/s)": 0.211859 }, { "epoch": 0.9591679506933745, "grad_norm": 2.11312198638916, "learning_rate": 0.0001017520285536439, "loss": 1.8686796188354493, "memory(GiB)": 105.37, "step": 2490, "token_acc": 0.575089556351612, "train_speed(iter/s)": 0.212098 }, { "epoch": 0.9610939907550077, "grad_norm": 0.931461751461029, "learning_rate": 0.00010164867123527815, "loss": 1.8880146026611329, "memory(GiB)": 105.37, "step": 2495, "token_acc": 0.5730290456431535, "train_speed(iter/s)": 0.211984 }, { "epoch": 0.963020030816641, "grad_norm": 0.7579106688499451, "learning_rate": 0.00010154513742371824, "loss": 1.878654670715332, "memory(GiB)": 105.37, "step": 2500, "token_acc": 0.5715559518502006, "train_speed(iter/s)": 0.212222 }, { "epoch": 0.9649460708782742, "grad_norm": 0.9832830429077148, "learning_rate": 0.00010144142758572364, "loss": 1.8780696868896485, "memory(GiB)": 105.37, "step": 2505, "token_acc": 0.5861377312235346, "train_speed(iter/s)": 0.212441 }, { "epoch": 0.9668721109399075, "grad_norm": 2.291651964187622, "learning_rate": 0.00010133754218884742, "loss": 1.8989700317382812, "memory(GiB)": 105.37, "step": 2510, "token_acc": 0.5676322719655255, "train_speed(iter/s)": 0.212319 }, { "epoch": 0.9687981510015409, "grad_norm": 0.7597490549087524, "learning_rate": 0.00010123348170143408, "loss": 1.8973007202148438, "memory(GiB)": 105.37, "step": 2515, "token_acc": 0.5610299579103738, "train_speed(iter/s)": 0.212287 }, { "epoch": 0.9707241910631741, "grad_norm": 1.1047621965408325, "learning_rate": 0.00010112924659261751, "loss": 1.8917285919189453, "memory(GiB)": 105.37, "step": 2520, "token_acc": 0.5817012569424145, "train_speed(iter/s)": 0.212107 }, { "epoch": 0.9726502311248074, "grad_norm": 0.755590558052063, "learning_rate": 0.00010102483733231882, "loss": 1.9304916381835937, "memory(GiB)": 105.37, "step": 2525, "token_acc": 0.5767375886524823, "train_speed(iter/s)": 0.21201 }, { "epoch": 0.9745762711864406, "grad_norm": 0.978504478931427, "learning_rate": 0.00010092025439124425, "loss": 1.8841156005859374, "memory(GiB)": 105.37, "step": 2530, "token_acc": 0.5961474593158419, "train_speed(iter/s)": 0.212219 }, { "epoch": 0.976502311248074, "grad_norm": 0.6544843316078186, "learning_rate": 0.00010081549824088304, "loss": 1.9175731658935546, "memory(GiB)": 105.37, "step": 2535, "token_acc": 0.5591259640102828, "train_speed(iter/s)": 0.212346 }, { "epoch": 0.9784283513097073, "grad_norm": 1.4386008977890015, "learning_rate": 0.0001007105693535053, "loss": 1.8448196411132813, "memory(GiB)": 118.24, "step": 2540, "token_acc": 0.5567567567567567, "train_speed(iter/s)": 0.212174 }, { "epoch": 0.9803543913713405, "grad_norm": 1.1577261686325073, "learning_rate": 0.00010060546820215991, "loss": 1.912937545776367, "memory(GiB)": 118.24, "step": 2545, "token_acc": 0.5594997241125621, "train_speed(iter/s)": 0.212406 }, { "epoch": 0.9822804314329738, "grad_norm": 1.6608984470367432, "learning_rate": 0.00010050019526067237, "loss": 1.8221038818359374, "memory(GiB)": 118.24, "step": 2550, "token_acc": 0.6011602610587382, "train_speed(iter/s)": 0.212397 }, { "epoch": 0.984206471494607, "grad_norm": 1.2616746425628662, "learning_rate": 0.00010039475100364256, "loss": 1.8744300842285155, "memory(GiB)": 118.24, "step": 2555, "token_acc": 0.5777464126087979, "train_speed(iter/s)": 0.212629 }, { "epoch": 0.9861325115562404, "grad_norm": 0.8126121759414673, "learning_rate": 0.00010028913590644287, "loss": 1.8420495986938477, "memory(GiB)": 118.24, "step": 2560, "token_acc": 0.5801255801255801, "train_speed(iter/s)": 0.212868 }, { "epoch": 0.9880585516178737, "grad_norm": 0.7576323747634888, "learning_rate": 0.00010018335044521572, "loss": 1.8606962203979491, "memory(GiB)": 118.24, "step": 2565, "token_acc": 0.5748314606741574, "train_speed(iter/s)": 0.212931 }, { "epoch": 0.9899845916795069, "grad_norm": 3.2989680767059326, "learning_rate": 0.0001000773950968717, "loss": 1.8900465011596679, "memory(GiB)": 118.24, "step": 2570, "token_acc": 0.5676959619952494, "train_speed(iter/s)": 0.213164 }, { "epoch": 0.9919106317411402, "grad_norm": 0.7823702096939087, "learning_rate": 9.997127033908721e-05, "loss": 1.8199888229370118, "memory(GiB)": 118.24, "step": 2575, "token_acc": 0.5861524582769508, "train_speed(iter/s)": 0.213399 }, { "epoch": 0.9938366718027735, "grad_norm": 6.944242477416992, "learning_rate": 9.986497665030247e-05, "loss": 1.900966262817383, "memory(GiB)": 118.24, "step": 2580, "token_acc": 0.5799475753604194, "train_speed(iter/s)": 0.213636 }, { "epoch": 0.9957627118644068, "grad_norm": 1.096247911453247, "learning_rate": 9.97585145097192e-05, "loss": 1.92723388671875, "memory(GiB)": 118.24, "step": 2585, "token_acc": 0.5740554156171285, "train_speed(iter/s)": 0.213873 }, { "epoch": 0.99768875192604, "grad_norm": 0.8583908081054688, "learning_rate": 9.965188439729867e-05, "loss": 1.852244758605957, "memory(GiB)": 118.24, "step": 2590, "token_acc": 0.5778296878318114, "train_speed(iter/s)": 0.214109 }, { "epoch": 0.9996147919876733, "grad_norm": 0.879838764667511, "learning_rate": 9.954508679375928e-05, "loss": 1.8662124633789063, "memory(GiB)": 118.24, "step": 2595, "token_acc": 0.5844184506731406, "train_speed(iter/s)": 0.214345 }, { "epoch": 1.0015408320493067, "grad_norm": 0.6492385268211365, "learning_rate": 9.943812218057466e-05, "loss": 1.8803394317626954, "memory(GiB)": 118.24, "step": 2600, "token_acc": 0.5794724007980492, "train_speed(iter/s)": 0.213595 }, { "epoch": 1.0034668721109399, "grad_norm": 0.6972906589508057, "learning_rate": 9.933099103997122e-05, "loss": 1.880356216430664, "memory(GiB)": 118.24, "step": 2605, "token_acc": 0.5773381294964028, "train_speed(iter/s)": 0.213827 }, { "epoch": 1.005392912172573, "grad_norm": 1.115248441696167, "learning_rate": 9.922369385492626e-05, "loss": 1.923149871826172, "memory(GiB)": 118.24, "step": 2610, "token_acc": 0.5678496868475992, "train_speed(iter/s)": 0.213621 }, { "epoch": 1.0073189522342065, "grad_norm": 1.3598155975341797, "learning_rate": 9.911623110916557e-05, "loss": 1.863555908203125, "memory(GiB)": 118.24, "step": 2615, "token_acc": 0.5800900185332274, "train_speed(iter/s)": 0.213852 }, { "epoch": 1.0092449922958397, "grad_norm": 0.837518036365509, "learning_rate": 9.900860328716135e-05, "loss": 1.8928642272949219, "memory(GiB)": 118.24, "step": 2620, "token_acc": 0.561210719105456, "train_speed(iter/s)": 0.214082 }, { "epoch": 1.011171032357473, "grad_norm": 0.7452426552772522, "learning_rate": 9.890081087413008e-05, "loss": 1.839437484741211, "memory(GiB)": 118.24, "step": 2625, "token_acc": 0.5713938805245264, "train_speed(iter/s)": 0.214139 }, { "epoch": 1.0130970724191064, "grad_norm": 0.8589769005775452, "learning_rate": 9.879285435603011e-05, "loss": 1.8793828964233399, "memory(GiB)": 118.24, "step": 2630, "token_acc": 0.6016576016576016, "train_speed(iter/s)": 0.214366 }, { "epoch": 1.0150231124807396, "grad_norm": 3.8594565391540527, "learning_rate": 9.868473421955979e-05, "loss": 1.8930324554443358, "memory(GiB)": 118.24, "step": 2635, "token_acc": 0.5802946148273364, "train_speed(iter/s)": 0.214391 }, { "epoch": 1.0169491525423728, "grad_norm": 6.350452899932861, "learning_rate": 9.857645095215496e-05, "loss": 1.8867511749267578, "memory(GiB)": 118.24, "step": 2640, "token_acc": 0.5820727026416799, "train_speed(iter/s)": 0.21462 }, { "epoch": 1.018875192604006, "grad_norm": 1.067470908164978, "learning_rate": 9.846800504198706e-05, "loss": 1.8895866394042968, "memory(GiB)": 118.24, "step": 2645, "token_acc": 0.5662457406293846, "train_speed(iter/s)": 0.214667 }, { "epoch": 1.0208012326656395, "grad_norm": 1.4716510772705078, "learning_rate": 9.835939697796059e-05, "loss": 1.8874019622802733, "memory(GiB)": 118.24, "step": 2650, "token_acc": 0.5717100941537114, "train_speed(iter/s)": 0.214657 }, { "epoch": 1.0227272727272727, "grad_norm": 2.5537991523742676, "learning_rate": 9.825062724971125e-05, "loss": 1.8482269287109374, "memory(GiB)": 118.24, "step": 2655, "token_acc": 0.5548946716232962, "train_speed(iter/s)": 0.214886 }, { "epoch": 1.024653312788906, "grad_norm": 1.1057168245315552, "learning_rate": 9.814169634760345e-05, "loss": 1.9174837112426757, "memory(GiB)": 118.24, "step": 2660, "token_acc": 0.5558971492453885, "train_speed(iter/s)": 0.214778 }, { "epoch": 1.0265793528505394, "grad_norm": 1.579986810684204, "learning_rate": 9.803260476272827e-05, "loss": 1.8766490936279296, "memory(GiB)": 118.24, "step": 2665, "token_acc": 0.5723290261582099, "train_speed(iter/s)": 0.214812 }, { "epoch": 1.0285053929121726, "grad_norm": 0.7831318378448486, "learning_rate": 9.792335298690119e-05, "loss": 1.8679998397827149, "memory(GiB)": 118.24, "step": 2670, "token_acc": 0.5653755617376418, "train_speed(iter/s)": 0.215039 }, { "epoch": 1.0304314329738058, "grad_norm": 0.7311432361602783, "learning_rate": 9.781394151265985e-05, "loss": 1.8989303588867188, "memory(GiB)": 118.24, "step": 2675, "token_acc": 0.5833557046979866, "train_speed(iter/s)": 0.215266 }, { "epoch": 1.0323574730354392, "grad_norm": 0.9940080046653748, "learning_rate": 9.770437083326191e-05, "loss": 1.8530050277709962, "memory(GiB)": 118.24, "step": 2680, "token_acc": 0.5813813813813814, "train_speed(iter/s)": 0.215329 }, { "epoch": 1.0342835130970724, "grad_norm": 2.6517465114593506, "learning_rate": 9.759464144268268e-05, "loss": 1.9058815002441407, "memory(GiB)": 118.24, "step": 2685, "token_acc": 0.5872814796047631, "train_speed(iter/s)": 0.215554 }, { "epoch": 1.0362095531587057, "grad_norm": 0.9095665812492371, "learning_rate": 9.74847538356131e-05, "loss": 1.8254484176635741, "memory(GiB)": 118.24, "step": 2690, "token_acc": 0.5883097165991903, "train_speed(iter/s)": 0.215478 }, { "epoch": 1.0381355932203389, "grad_norm": 0.6931060552597046, "learning_rate": 9.737470850745731e-05, "loss": 1.852724838256836, "memory(GiB)": 118.24, "step": 2695, "token_acc": 0.5661989017693716, "train_speed(iter/s)": 0.215705 }, { "epoch": 1.0400616332819723, "grad_norm": 0.8766068816184998, "learning_rate": 9.726450595433054e-05, "loss": 1.837939453125, "memory(GiB)": 118.24, "step": 2700, "token_acc": 0.5932343234323433, "train_speed(iter/s)": 0.215919 }, { "epoch": 1.0419876733436055, "grad_norm": 0.851811408996582, "learning_rate": 9.715414667305676e-05, "loss": 1.894862747192383, "memory(GiB)": 118.24, "step": 2705, "token_acc": 0.5743899239044871, "train_speed(iter/s)": 0.215611 }, { "epoch": 1.0439137134052388, "grad_norm": 0.9929028153419495, "learning_rate": 9.704363116116664e-05, "loss": 1.8359031677246094, "memory(GiB)": 118.24, "step": 2710, "token_acc": 0.5987220447284345, "train_speed(iter/s)": 0.215835 }, { "epoch": 1.0458397534668722, "grad_norm": 1.2110342979431152, "learning_rate": 9.69329599168951e-05, "loss": 1.882303810119629, "memory(GiB)": 118.24, "step": 2715, "token_acc": 0.5893077112589308, "train_speed(iter/s)": 0.216057 }, { "epoch": 1.0477657935285054, "grad_norm": 0.7954553961753845, "learning_rate": 9.682213343917914e-05, "loss": 1.8980537414550782, "memory(GiB)": 118.24, "step": 2720, "token_acc": 0.5677123182861515, "train_speed(iter/s)": 0.216238 }, { "epoch": 1.0496918335901386, "grad_norm": 0.8508651852607727, "learning_rate": 9.671115222765564e-05, "loss": 1.8639345169067383, "memory(GiB)": 118.24, "step": 2725, "token_acc": 0.5630630630630631, "train_speed(iter/s)": 0.216391 }, { "epoch": 1.051617873651772, "grad_norm": 1.146342396736145, "learning_rate": 9.660001678265905e-05, "loss": 1.8648239135742188, "memory(GiB)": 118.24, "step": 2730, "token_acc": 0.5886489201406329, "train_speed(iter/s)": 0.21647 }, { "epoch": 1.0535439137134053, "grad_norm": 7.731226444244385, "learning_rate": 9.648872760521909e-05, "loss": 1.8974201202392578, "memory(GiB)": 118.24, "step": 2735, "token_acc": 0.5776738511590077, "train_speed(iter/s)": 0.216688 }, { "epoch": 1.0554699537750385, "grad_norm": 1.080702304840088, "learning_rate": 9.637728519705864e-05, "loss": 1.8359441757202148, "memory(GiB)": 118.24, "step": 2740, "token_acc": 0.5879754601226994, "train_speed(iter/s)": 0.216693 }, { "epoch": 1.0573959938366717, "grad_norm": 0.6086855530738831, "learning_rate": 9.626569006059135e-05, "loss": 1.8823871612548828, "memory(GiB)": 118.24, "step": 2745, "token_acc": 0.5659057437407953, "train_speed(iter/s)": 0.216912 }, { "epoch": 1.0593220338983051, "grad_norm": 2.9040892124176025, "learning_rate": 9.615394269891936e-05, "loss": 1.916671371459961, "memory(GiB)": 118.24, "step": 2750, "token_acc": 0.5639880952380952, "train_speed(iter/s)": 0.217133 }, { "epoch": 1.0612480739599384, "grad_norm": 1.326704502105713, "learning_rate": 9.604204361583117e-05, "loss": 1.8886991500854493, "memory(GiB)": 118.24, "step": 2755, "token_acc": 0.5787476280834914, "train_speed(iter/s)": 0.217357 }, { "epoch": 1.0631741140215716, "grad_norm": 1.0250605344772339, "learning_rate": 9.592999331579924e-05, "loss": 1.8586359024047852, "memory(GiB)": 118.24, "step": 2760, "token_acc": 0.5995157384987894, "train_speed(iter/s)": 0.217578 }, { "epoch": 1.065100154083205, "grad_norm": 1.0501981973648071, "learning_rate": 9.581779230397772e-05, "loss": 1.8740936279296876, "memory(GiB)": 118.24, "step": 2765, "token_acc": 0.5730209281164695, "train_speed(iter/s)": 0.217476 }, { "epoch": 1.0670261941448382, "grad_norm": 0.7434837222099304, "learning_rate": 9.570544108620033e-05, "loss": 1.8510187149047852, "memory(GiB)": 118.24, "step": 2770, "token_acc": 0.5614591593973037, "train_speed(iter/s)": 0.217691 }, { "epoch": 1.0689522342064715, "grad_norm": 0.9832238554954529, "learning_rate": 9.55929401689778e-05, "loss": 1.8899845123291015, "memory(GiB)": 118.24, "step": 2775, "token_acc": 0.5928844854762441, "train_speed(iter/s)": 0.217658 }, { "epoch": 1.0708782742681047, "grad_norm": 0.890831470489502, "learning_rate": 9.548029005949589e-05, "loss": 1.8917844772338868, "memory(GiB)": 118.24, "step": 2780, "token_acc": 0.5754400670578373, "train_speed(iter/s)": 0.21786 }, { "epoch": 1.072804314329738, "grad_norm": 1.2053302526474, "learning_rate": 9.536749126561286e-05, "loss": 1.8872817993164062, "memory(GiB)": 118.24, "step": 2785, "token_acc": 0.5819516816674561, "train_speed(iter/s)": 0.217764 }, { "epoch": 1.0747303543913713, "grad_norm": 1.0404961109161377, "learning_rate": 9.525454429585736e-05, "loss": 1.9375843048095702, "memory(GiB)": 118.24, "step": 2790, "token_acc": 0.5622685185185186, "train_speed(iter/s)": 0.217979 }, { "epoch": 1.0766563944530045, "grad_norm": 0.8875176906585693, "learning_rate": 9.514144965942599e-05, "loss": 1.8680692672729493, "memory(GiB)": 118.24, "step": 2795, "token_acc": 0.5834532374100719, "train_speed(iter/s)": 0.218193 }, { "epoch": 1.078582434514638, "grad_norm": 1.6092698574066162, "learning_rate": 9.502820786618111e-05, "loss": 1.8898666381835938, "memory(GiB)": 118.24, "step": 2800, "token_acc": 0.5776892430278885, "train_speed(iter/s)": 0.218343 }, { "epoch": 1.0805084745762712, "grad_norm": 0.8939402103424072, "learning_rate": 9.491481942664849e-05, "loss": 1.869072723388672, "memory(GiB)": 118.24, "step": 2805, "token_acc": 0.567577900974957, "train_speed(iter/s)": 0.218545 }, { "epoch": 1.0824345146379044, "grad_norm": 0.9410150647163391, "learning_rate": 9.480128485201505e-05, "loss": 1.852294921875, "memory(GiB)": 118.24, "step": 2810, "token_acc": 0.6026355803345159, "train_speed(iter/s)": 0.21871 }, { "epoch": 1.0843605546995378, "grad_norm": 0.8424032926559448, "learning_rate": 9.468760465412652e-05, "loss": 1.8639339447021483, "memory(GiB)": 118.24, "step": 2815, "token_acc": 0.569980694980695, "train_speed(iter/s)": 0.218882 }, { "epoch": 1.086286594761171, "grad_norm": 0.6092885136604309, "learning_rate": 9.457377934548507e-05, "loss": 1.7856494903564453, "memory(GiB)": 118.24, "step": 2820, "token_acc": 0.5842880523731587, "train_speed(iter/s)": 0.219092 }, { "epoch": 1.0882126348228043, "grad_norm": 0.7894574403762817, "learning_rate": 9.445980943924717e-05, "loss": 1.9051006317138672, "memory(GiB)": 118.24, "step": 2825, "token_acc": 0.5816425120772947, "train_speed(iter/s)": 0.218839 }, { "epoch": 1.0901386748844375, "grad_norm": 1.060431718826294, "learning_rate": 9.434569544922112e-05, "loss": 1.8405721664428711, "memory(GiB)": 118.24, "step": 2830, "token_acc": 0.5871559633027523, "train_speed(iter/s)": 0.219048 }, { "epoch": 1.092064714946071, "grad_norm": 1.3697607517242432, "learning_rate": 9.423143788986483e-05, "loss": 1.8477794647216796, "memory(GiB)": 118.24, "step": 2835, "token_acc": 0.583436087135224, "train_speed(iter/s)": 0.218892 }, { "epoch": 1.0939907550077042, "grad_norm": 0.6515471339225769, "learning_rate": 9.411703727628343e-05, "loss": 1.8501924514770507, "memory(GiB)": 118.24, "step": 2840, "token_acc": 0.5769669327251995, "train_speed(iter/s)": 0.219104 }, { "epoch": 1.0959167950693374, "grad_norm": 1.0552825927734375, "learning_rate": 9.400249412422693e-05, "loss": 1.831197738647461, "memory(GiB)": 118.24, "step": 2845, "token_acc": 0.5694606584169974, "train_speed(iter/s)": 0.219168 }, { "epoch": 1.0978428351309708, "grad_norm": 0.6685405373573303, "learning_rate": 9.388780895008809e-05, "loss": 1.8796417236328125, "memory(GiB)": 118.24, "step": 2850, "token_acc": 0.5924134419551935, "train_speed(iter/s)": 0.219229 }, { "epoch": 1.099768875192604, "grad_norm": 0.920935869216919, "learning_rate": 9.377298227089976e-05, "loss": 1.877511978149414, "memory(GiB)": 118.24, "step": 2855, "token_acc": 0.5651423641069888, "train_speed(iter/s)": 0.219441 }, { "epoch": 1.1016949152542372, "grad_norm": 1.1936856508255005, "learning_rate": 9.365801460433288e-05, "loss": 1.8152345657348632, "memory(GiB)": 118.24, "step": 2860, "token_acc": 0.5614118769377534, "train_speed(iter/s)": 0.219653 }, { "epoch": 1.1036209553158707, "grad_norm": 1.0216765403747559, "learning_rate": 9.354290646869395e-05, "loss": 1.8699501037597657, "memory(GiB)": 118.24, "step": 2865, "token_acc": 0.5882352941176471, "train_speed(iter/s)": 0.219635 }, { "epoch": 1.105546995377504, "grad_norm": 0.9820363521575928, "learning_rate": 9.342765838292274e-05, "loss": 1.8355649948120116, "memory(GiB)": 118.24, "step": 2870, "token_acc": 0.5686054345385133, "train_speed(iter/s)": 0.219826 }, { "epoch": 1.107473035439137, "grad_norm": 1.0165764093399048, "learning_rate": 9.331227086658993e-05, "loss": 1.8532234191894532, "memory(GiB)": 118.24, "step": 2875, "token_acc": 0.5907317073170731, "train_speed(iter/s)": 0.219819 }, { "epoch": 1.1093990755007703, "grad_norm": 0.9640690088272095, "learning_rate": 9.319674443989484e-05, "loss": 1.8951274871826171, "memory(GiB)": 118.24, "step": 2880, "token_acc": 0.5604702131898784, "train_speed(iter/s)": 0.22003 }, { "epoch": 1.1113251155624038, "grad_norm": 1.0514110326766968, "learning_rate": 9.308107962366301e-05, "loss": 1.9084840774536134, "memory(GiB)": 118.24, "step": 2885, "token_acc": 0.5889642962525818, "train_speed(iter/s)": 0.219951 }, { "epoch": 1.113251155624037, "grad_norm": 1.5298981666564941, "learning_rate": 9.29652769393439e-05, "loss": 1.9044412612915038, "memory(GiB)": 118.24, "step": 2890, "token_acc": 0.5630640083945435, "train_speed(iter/s)": 0.220151 }, { "epoch": 1.1151771956856702, "grad_norm": 0.8108352422714233, "learning_rate": 9.284933690900847e-05, "loss": 1.8176475524902345, "memory(GiB)": 118.24, "step": 2895, "token_acc": 0.579942242058283, "train_speed(iter/s)": 0.220293 }, { "epoch": 1.1171032357473036, "grad_norm": 1.4489328861236572, "learning_rate": 9.273326005534693e-05, "loss": 1.844976806640625, "memory(GiB)": 118.24, "step": 2900, "token_acc": 0.5795043882292205, "train_speed(iter/s)": 0.220362 }, { "epoch": 1.1190292758089369, "grad_norm": 1.0090405941009521, "learning_rate": 9.26170469016663e-05, "loss": 1.8660137176513671, "memory(GiB)": 118.24, "step": 2905, "token_acc": 0.5674379232505643, "train_speed(iter/s)": 0.2204 }, { "epoch": 1.12095531587057, "grad_norm": 1.2113709449768066, "learning_rate": 9.250069797188809e-05, "loss": 1.9027469635009766, "memory(GiB)": 118.24, "step": 2910, "token_acc": 0.5722858701582105, "train_speed(iter/s)": 0.220482 }, { "epoch": 1.1228813559322033, "grad_norm": 0.8399081826210022, "learning_rate": 9.238421379054591e-05, "loss": 1.866159439086914, "memory(GiB)": 118.24, "step": 2915, "token_acc": 0.5893015030946065, "train_speed(iter/s)": 0.220694 }, { "epoch": 1.1248073959938367, "grad_norm": 0.8414112329483032, "learning_rate": 9.226759488278315e-05, "loss": 1.8603809356689454, "memory(GiB)": 118.24, "step": 2920, "token_acc": 0.5744300402324541, "train_speed(iter/s)": 0.220408 }, { "epoch": 1.12673343605547, "grad_norm": 1.120094895362854, "learning_rate": 9.215084177435055e-05, "loss": 1.8289287567138672, "memory(GiB)": 118.24, "step": 2925, "token_acc": 0.5891046073601854, "train_speed(iter/s)": 0.220612 }, { "epoch": 1.1286594761171032, "grad_norm": 1.9631211757659912, "learning_rate": 9.203395499160385e-05, "loss": 1.869622039794922, "memory(GiB)": 118.24, "step": 2930, "token_acc": 0.5723039215686274, "train_speed(iter/s)": 0.22082 }, { "epoch": 1.1305855161787366, "grad_norm": 0.8741260766983032, "learning_rate": 9.191693506150153e-05, "loss": 1.8904369354248047, "memory(GiB)": 118.24, "step": 2935, "token_acc": 0.5756207674943566, "train_speed(iter/s)": 0.220692 }, { "epoch": 1.1325115562403698, "grad_norm": 0.961950421333313, "learning_rate": 9.179978251160223e-05, "loss": 1.8798887252807617, "memory(GiB)": 118.24, "step": 2940, "token_acc": 0.563659095644926, "train_speed(iter/s)": 0.220896 }, { "epoch": 1.134437596302003, "grad_norm": 0.8654031753540039, "learning_rate": 9.168249787006253e-05, "loss": 1.9256160736083985, "memory(GiB)": 118.24, "step": 2945, "token_acc": 0.5829567462879277, "train_speed(iter/s)": 0.221098 }, { "epoch": 1.1363636363636362, "grad_norm": 0.8082730174064636, "learning_rate": 9.156508166563447e-05, "loss": 1.8584487915039063, "memory(GiB)": 118.24, "step": 2950, "token_acc": 0.5865949119373777, "train_speed(iter/s)": 0.221076 }, { "epoch": 1.1382896764252697, "grad_norm": 1.8858978748321533, "learning_rate": 9.144753442766326e-05, "loss": 1.880162811279297, "memory(GiB)": 118.24, "step": 2955, "token_acc": 0.5858250276854928, "train_speed(iter/s)": 0.22128 }, { "epoch": 1.140215716486903, "grad_norm": 1.3983076810836792, "learning_rate": 9.132985668608487e-05, "loss": 1.8480472564697266, "memory(GiB)": 118.24, "step": 2960, "token_acc": 0.5732368896925859, "train_speed(iter/s)": 0.221003 }, { "epoch": 1.1421417565485361, "grad_norm": 1.125353455543518, "learning_rate": 9.121204897142352e-05, "loss": 1.8179750442504883, "memory(GiB)": 118.24, "step": 2965, "token_acc": 0.5801740211311374, "train_speed(iter/s)": 0.221212 }, { "epoch": 1.1440677966101696, "grad_norm": 1.2973246574401855, "learning_rate": 9.109411181478946e-05, "loss": 1.9305080413818358, "memory(GiB)": 118.24, "step": 2970, "token_acc": 0.5736081370449678, "train_speed(iter/s)": 0.221026 }, { "epoch": 1.1459938366718028, "grad_norm": 1.136041283607483, "learning_rate": 9.097604574787648e-05, "loss": 1.8189834594726562, "memory(GiB)": 118.24, "step": 2975, "token_acc": 0.5642458100558659, "train_speed(iter/s)": 0.221228 }, { "epoch": 1.147919876733436, "grad_norm": 1.2743477821350098, "learning_rate": 9.085785130295955e-05, "loss": 1.892550277709961, "memory(GiB)": 118.24, "step": 2980, "token_acc": 0.5596406935450178, "train_speed(iter/s)": 0.221435 }, { "epoch": 1.1498459167950694, "grad_norm": 1.2965178489685059, "learning_rate": 9.07395290128924e-05, "loss": 1.8549304962158204, "memory(GiB)": 118.24, "step": 2985, "token_acc": 0.5720962841785464, "train_speed(iter/s)": 0.22112 }, { "epoch": 1.1517719568567026, "grad_norm": 0.9816954731941223, "learning_rate": 9.062107941110509e-05, "loss": 1.8125295639038086, "memory(GiB)": 118.24, "step": 2990, "token_acc": 0.5752312203925107, "train_speed(iter/s)": 0.221322 }, { "epoch": 1.1536979969183359, "grad_norm": 0.9750504493713379, "learning_rate": 9.050250303160164e-05, "loss": 1.817061424255371, "memory(GiB)": 118.24, "step": 2995, "token_acc": 0.5753185111166625, "train_speed(iter/s)": 0.221079 }, { "epoch": 1.1556240369799693, "grad_norm": 1.5480351448059082, "learning_rate": 9.038380040895768e-05, "loss": 1.8436656951904298, "memory(GiB)": 118.24, "step": 3000, "token_acc": 0.5868163362789587, "train_speed(iter/s)": 0.221277 }, { "epoch": 1.1575500770416025, "grad_norm": 0.8106587529182434, "learning_rate": 9.026497207831792e-05, "loss": 1.8772392272949219, "memory(GiB)": 118.24, "step": 3005, "token_acc": 0.5850395850395851, "train_speed(iter/s)": 0.221481 }, { "epoch": 1.1594761171032357, "grad_norm": 0.7256246209144592, "learning_rate": 9.014601857539383e-05, "loss": 1.8514884948730468, "memory(GiB)": 118.24, "step": 3010, "token_acc": 0.5796740606609325, "train_speed(iter/s)": 0.221547 }, { "epoch": 1.161402157164869, "grad_norm": 1.2435458898544312, "learning_rate": 9.002694043646114e-05, "loss": 1.8791698455810546, "memory(GiB)": 118.24, "step": 3015, "token_acc": 0.5656286043829296, "train_speed(iter/s)": 0.221751 }, { "epoch": 1.1633281972265024, "grad_norm": 0.9466080665588379, "learning_rate": 8.990773819835754e-05, "loss": 1.9109966278076171, "memory(GiB)": 118.24, "step": 3020, "token_acc": 0.5880651945320715, "train_speed(iter/s)": 0.221762 }, { "epoch": 1.1652542372881356, "grad_norm": 0.7421003580093384, "learning_rate": 8.978841239848015e-05, "loss": 1.8328750610351563, "memory(GiB)": 118.24, "step": 3025, "token_acc": 0.5808431163287087, "train_speed(iter/s)": 0.221963 }, { "epoch": 1.1671802773497688, "grad_norm": 1.3435719013214111, "learning_rate": 8.966896357478319e-05, "loss": 1.8882432937622071, "memory(GiB)": 118.24, "step": 3030, "token_acc": 0.5630724396336386, "train_speed(iter/s)": 0.221895 }, { "epoch": 1.1691063174114023, "grad_norm": 0.9989566802978516, "learning_rate": 8.954939226577544e-05, "loss": 1.871353530883789, "memory(GiB)": 118.24, "step": 3035, "token_acc": 0.5589080459770115, "train_speed(iter/s)": 0.2221 }, { "epoch": 1.1710323574730355, "grad_norm": 1.1358001232147217, "learning_rate": 8.94296990105179e-05, "loss": 1.8150867462158202, "memory(GiB)": 118.24, "step": 3040, "token_acc": 0.5797297297297297, "train_speed(iter/s)": 0.222303 }, { "epoch": 1.1729583975346687, "grad_norm": 0.890850305557251, "learning_rate": 8.930988434862136e-05, "loss": 1.8281471252441406, "memory(GiB)": 118.24, "step": 3045, "token_acc": 0.5876861524783286, "train_speed(iter/s)": 0.222266 }, { "epoch": 1.174884437596302, "grad_norm": 1.2370262145996094, "learning_rate": 8.918994882024395e-05, "loss": 1.8287195205688476, "memory(GiB)": 118.24, "step": 3050, "token_acc": 0.5700222882615156, "train_speed(iter/s)": 0.222459 }, { "epoch": 1.1768104776579353, "grad_norm": 1.085956335067749, "learning_rate": 8.906989296608868e-05, "loss": 1.8601539611816407, "memory(GiB)": 118.24, "step": 3055, "token_acc": 0.5782970119074365, "train_speed(iter/s)": 0.222433 }, { "epoch": 1.1787365177195686, "grad_norm": 0.8186383843421936, "learning_rate": 8.894971732740099e-05, "loss": 1.8926618576049805, "memory(GiB)": 118.24, "step": 3060, "token_acc": 0.5794753086419753, "train_speed(iter/s)": 0.22263 }, { "epoch": 1.1806625577812018, "grad_norm": 2.645453929901123, "learning_rate": 8.882942244596642e-05, "loss": 1.8511808395385743, "memory(GiB)": 118.24, "step": 3065, "token_acc": 0.582378223495702, "train_speed(iter/s)": 0.222751 }, { "epoch": 1.1825885978428352, "grad_norm": 1.095625638961792, "learning_rate": 8.870900886410802e-05, "loss": 1.808194351196289, "memory(GiB)": 118.24, "step": 3070, "token_acc": 0.5716953724839178, "train_speed(iter/s)": 0.22279 }, { "epoch": 1.1845146379044684, "grad_norm": 2.681864023208618, "learning_rate": 8.858847712468403e-05, "loss": 1.8524499893188477, "memory(GiB)": 118.24, "step": 3075, "token_acc": 0.5653803748621831, "train_speed(iter/s)": 0.222991 }, { "epoch": 1.1864406779661016, "grad_norm": 1.5897804498672485, "learning_rate": 8.846782777108532e-05, "loss": 1.8668397903442382, "memory(GiB)": 118.24, "step": 3080, "token_acc": 0.5648094964579743, "train_speed(iter/s)": 0.222841 }, { "epoch": 1.1883667180277349, "grad_norm": 0.9641701579093933, "learning_rate": 8.834706134723305e-05, "loss": 1.8878570556640626, "memory(GiB)": 118.24, "step": 3085, "token_acc": 0.5698746748640341, "train_speed(iter/s)": 0.223038 }, { "epoch": 1.1902927580893683, "grad_norm": 1.1126004457473755, "learning_rate": 8.822617839757612e-05, "loss": 1.8906505584716797, "memory(GiB)": 118.24, "step": 3090, "token_acc": 0.5807913017215343, "train_speed(iter/s)": 0.223049 }, { "epoch": 1.1922187981510015, "grad_norm": 1.2366658449172974, "learning_rate": 8.810517946708882e-05, "loss": 1.813461685180664, "memory(GiB)": 118.24, "step": 3095, "token_acc": 0.583248987854251, "train_speed(iter/s)": 0.223244 }, { "epoch": 1.1941448382126347, "grad_norm": 0.7631458640098572, "learning_rate": 8.798406510126824e-05, "loss": 1.8438899993896485, "memory(GiB)": 118.24, "step": 3100, "token_acc": 0.5801459854014599, "train_speed(iter/s)": 0.22344 }, { "epoch": 1.1960708782742682, "grad_norm": 1.4643558263778687, "learning_rate": 8.786283584613194e-05, "loss": 1.8446216583251953, "memory(GiB)": 118.24, "step": 3105, "token_acc": 0.5754263226934849, "train_speed(iter/s)": 0.223286 }, { "epoch": 1.1979969183359014, "grad_norm": 1.0200318098068237, "learning_rate": 8.774149224821541e-05, "loss": 1.7834148406982422, "memory(GiB)": 118.24, "step": 3110, "token_acc": 0.589795402879515, "train_speed(iter/s)": 0.223476 }, { "epoch": 1.1999229583975346, "grad_norm": 2.9114532470703125, "learning_rate": 8.762003485456965e-05, "loss": 1.8702865600585938, "memory(GiB)": 118.24, "step": 3115, "token_acc": 0.5773822444106794, "train_speed(iter/s)": 0.223401 }, { "epoch": 1.201848998459168, "grad_norm": 1.6492737531661987, "learning_rate": 8.749846421275865e-05, "loss": 1.8790077209472655, "memory(GiB)": 118.24, "step": 3120, "token_acc": 0.5629596612435926, "train_speed(iter/s)": 0.223598 }, { "epoch": 1.2037750385208013, "grad_norm": 0.7615155577659607, "learning_rate": 8.737678087085699e-05, "loss": 1.8393915176391602, "memory(GiB)": 118.24, "step": 3125, "token_acc": 0.6077547339945897, "train_speed(iter/s)": 0.223262 }, { "epoch": 1.2057010785824345, "grad_norm": 0.9724581241607666, "learning_rate": 8.725498537744731e-05, "loss": 1.8485027313232423, "memory(GiB)": 118.24, "step": 3130, "token_acc": 0.5794111756459043, "train_speed(iter/s)": 0.223452 }, { "epoch": 1.207627118644068, "grad_norm": 0.8728950023651123, "learning_rate": 8.713307828161786e-05, "loss": 1.856772232055664, "memory(GiB)": 118.24, "step": 3135, "token_acc": 0.5716000685988681, "train_speed(iter/s)": 0.223647 }, { "epoch": 1.2095531587057011, "grad_norm": 0.9881525635719299, "learning_rate": 8.701106013296005e-05, "loss": 1.8500242233276367, "memory(GiB)": 118.24, "step": 3140, "token_acc": 0.5573841489822434, "train_speed(iter/s)": 0.223356 }, { "epoch": 1.2114791987673343, "grad_norm": 1.1273807287216187, "learning_rate": 8.68889314815659e-05, "loss": 1.8441329956054688, "memory(GiB)": 118.24, "step": 3145, "token_acc": 0.5582089552238806, "train_speed(iter/s)": 0.223549 }, { "epoch": 1.2134052388289676, "grad_norm": 0.8422824144363403, "learning_rate": 8.676669287802565e-05, "loss": 1.8579490661621094, "memory(GiB)": 118.24, "step": 3150, "token_acc": 0.5595683770094693, "train_speed(iter/s)": 0.223431 }, { "epoch": 1.215331278890601, "grad_norm": 1.3149006366729736, "learning_rate": 8.664434487342527e-05, "loss": 1.8522964477539063, "memory(GiB)": 118.24, "step": 3155, "token_acc": 0.570446735395189, "train_speed(iter/s)": 0.223626 }, { "epoch": 1.2172573189522342, "grad_norm": 0.627025842666626, "learning_rate": 8.652188801934383e-05, "loss": 1.864504623413086, "memory(GiB)": 118.24, "step": 3160, "token_acc": 0.5655122305643013, "train_speed(iter/s)": 0.223821 }, { "epoch": 1.2191833590138674, "grad_norm": 1.0293751955032349, "learning_rate": 8.639932286785119e-05, "loss": 1.8348306655883788, "memory(GiB)": 118.24, "step": 3165, "token_acc": 0.5644485807352256, "train_speed(iter/s)": 0.223785 }, { "epoch": 1.2211093990755009, "grad_norm": 1.1320598125457764, "learning_rate": 8.627664997150548e-05, "loss": 1.8503002166748046, "memory(GiB)": 118.24, "step": 3170, "token_acc": 0.5802525832376578, "train_speed(iter/s)": 0.223978 }, { "epoch": 1.223035439137134, "grad_norm": 1.042977213859558, "learning_rate": 8.61538698833505e-05, "loss": 1.8537403106689454, "memory(GiB)": 118.24, "step": 3175, "token_acc": 0.5747868172389952, "train_speed(iter/s)": 0.223844 }, { "epoch": 1.2249614791987673, "grad_norm": 1.134169340133667, "learning_rate": 8.603098315691337e-05, "loss": 1.8022125244140625, "memory(GiB)": 118.24, "step": 3180, "token_acc": 0.5909769943232746, "train_speed(iter/s)": 0.224032 }, { "epoch": 1.2268875192604005, "grad_norm": 0.7309772372245789, "learning_rate": 8.590799034620191e-05, "loss": 1.8356678009033203, "memory(GiB)": 118.24, "step": 3185, "token_acc": 0.5786475105276195, "train_speed(iter/s)": 0.22404 }, { "epoch": 1.228813559322034, "grad_norm": 0.8766815066337585, "learning_rate": 8.57848920057022e-05, "loss": 1.856044387817383, "memory(GiB)": 118.24, "step": 3190, "token_acc": 0.5844271412680756, "train_speed(iter/s)": 0.224106 }, { "epoch": 1.2307395993836672, "grad_norm": 1.5134860277175903, "learning_rate": 8.566168869037614e-05, "loss": 1.8417312622070312, "memory(GiB)": 118.24, "step": 3195, "token_acc": 0.5687395758875388, "train_speed(iter/s)": 0.224027 }, { "epoch": 1.2326656394453004, "grad_norm": 1.8685661554336548, "learning_rate": 8.553838095565883e-05, "loss": 1.8797491073608399, "memory(GiB)": 118.24, "step": 3200, "token_acc": 0.5593988058472308, "train_speed(iter/s)": 0.224212 }, { "epoch": 1.2345916795069338, "grad_norm": 2.2050652503967285, "learning_rate": 8.541496935745613e-05, "loss": 1.8161453247070312, "memory(GiB)": 118.24, "step": 3205, "token_acc": 0.5730733082706767, "train_speed(iter/s)": 0.224082 }, { "epoch": 1.236517719568567, "grad_norm": 0.7844215035438538, "learning_rate": 8.529145445214213e-05, "loss": 1.8313411712646483, "memory(GiB)": 118.24, "step": 3210, "token_acc": 0.5796633617708093, "train_speed(iter/s)": 0.224217 }, { "epoch": 1.2384437596302003, "grad_norm": 1.1738195419311523, "learning_rate": 8.516783679655671e-05, "loss": 1.8096988677978516, "memory(GiB)": 118.24, "step": 3215, "token_acc": 0.5807476178841925, "train_speed(iter/s)": 0.223872 }, { "epoch": 1.2403697996918335, "grad_norm": 1.4127227067947388, "learning_rate": 8.504411694800294e-05, "loss": 1.8220989227294921, "memory(GiB)": 118.24, "step": 3220, "token_acc": 0.5868175110673881, "train_speed(iter/s)": 0.224058 }, { "epoch": 1.242295839753467, "grad_norm": 1.0065556764602661, "learning_rate": 8.492029546424462e-05, "loss": 1.828787612915039, "memory(GiB)": 118.24, "step": 3225, "token_acc": 0.5677614194035485, "train_speed(iter/s)": 0.224245 }, { "epoch": 1.2442218798151001, "grad_norm": 0.7304002642631531, "learning_rate": 8.47963729035037e-05, "loss": 1.8517780303955078, "memory(GiB)": 118.24, "step": 3230, "token_acc": 0.5659461843846493, "train_speed(iter/s)": 0.223844 }, { "epoch": 1.2461479198767333, "grad_norm": 1.2463603019714355, "learning_rate": 8.46723498244579e-05, "loss": 1.821853256225586, "memory(GiB)": 118.24, "step": 3235, "token_acc": 0.5812310797174571, "train_speed(iter/s)": 0.22403 }, { "epoch": 1.2480739599383668, "grad_norm": 1.53412663936615, "learning_rate": 8.454822678623803e-05, "loss": 1.86295166015625, "memory(GiB)": 118.24, "step": 3240, "token_acc": 0.5861274635270028, "train_speed(iter/s)": 0.223644 }, { "epoch": 1.25, "grad_norm": 0.7859674692153931, "learning_rate": 8.442400434842557e-05, "loss": 1.839095687866211, "memory(GiB)": 118.24, "step": 3245, "token_acc": 0.5497198879551821, "train_speed(iter/s)": 0.223827 }, { "epoch": 1.2519260400616332, "grad_norm": 1.0808963775634766, "learning_rate": 8.429968307105014e-05, "loss": 1.8195180892944336, "memory(GiB)": 118.24, "step": 3250, "token_acc": 0.5808022258288894, "train_speed(iter/s)": 0.223724 }, { "epoch": 1.2538520801232664, "grad_norm": 0.9158240556716919, "learning_rate": 8.417526351458694e-05, "loss": 1.8539520263671876, "memory(GiB)": 118.24, "step": 3255, "token_acc": 0.5771712158808933, "train_speed(iter/s)": 0.223914 }, { "epoch": 1.2557781201848999, "grad_norm": 0.76888507604599, "learning_rate": 8.405074623995424e-05, "loss": 1.8630853652954102, "memory(GiB)": 118.24, "step": 3260, "token_acc": 0.5708838043965904, "train_speed(iter/s)": 0.224102 }, { "epoch": 1.257704160246533, "grad_norm": 0.9579616785049438, "learning_rate": 8.392613180851082e-05, "loss": 1.803414535522461, "memory(GiB)": 118.24, "step": 3265, "token_acc": 0.5825285338015803, "train_speed(iter/s)": 0.224032 }, { "epoch": 1.2596302003081665, "grad_norm": 1.0696918964385986, "learning_rate": 8.380142078205355e-05, "loss": 1.821596908569336, "memory(GiB)": 118.24, "step": 3270, "token_acc": 0.5844785772029103, "train_speed(iter/s)": 0.224212 }, { "epoch": 1.2615562403697997, "grad_norm": 0.9113172292709351, "learning_rate": 8.367661372281469e-05, "loss": 1.8017152786254882, "memory(GiB)": 118.24, "step": 3275, "token_acc": 0.5840116885827593, "train_speed(iter/s)": 0.224053 }, { "epoch": 1.263482280431433, "grad_norm": 0.9522203207015991, "learning_rate": 8.35517111934595e-05, "loss": 1.7981292724609375, "memory(GiB)": 118.24, "step": 3280, "token_acc": 0.5719459198454853, "train_speed(iter/s)": 0.224241 }, { "epoch": 1.2654083204930662, "grad_norm": 1.0223705768585205, "learning_rate": 8.342671375708364e-05, "loss": 1.816117286682129, "memory(GiB)": 118.24, "step": 3285, "token_acc": 0.5777317145395321, "train_speed(iter/s)": 0.224425 }, { "epoch": 1.2673343605546996, "grad_norm": 0.9167478680610657, "learning_rate": 8.330162197721059e-05, "loss": 1.8301067352294922, "memory(GiB)": 118.24, "step": 3290, "token_acc": 0.5863420672580978, "train_speed(iter/s)": 0.224384 }, { "epoch": 1.2692604006163328, "grad_norm": 1.276617407798767, "learning_rate": 8.317643641778919e-05, "loss": 1.870458984375, "memory(GiB)": 118.24, "step": 3295, "token_acc": 0.5766210455463316, "train_speed(iter/s)": 0.224569 }, { "epoch": 1.271186440677966, "grad_norm": 0.8517452478408813, "learning_rate": 8.30511576431911e-05, "loss": 1.8094181060791015, "memory(GiB)": 118.24, "step": 3300, "token_acc": 0.5764476252439817, "train_speed(iter/s)": 0.224404 }, { "epoch": 1.2731124807395995, "grad_norm": 0.8477849364280701, "learning_rate": 8.292578621820818e-05, "loss": 1.7702598571777344, "memory(GiB)": 118.24, "step": 3305, "token_acc": 0.5919067215363512, "train_speed(iter/s)": 0.224578 }, { "epoch": 1.2750385208012327, "grad_norm": 0.9045779705047607, "learning_rate": 8.280032270804996e-05, "loss": 1.8854120254516602, "memory(GiB)": 118.24, "step": 3310, "token_acc": 0.5799006719252118, "train_speed(iter/s)": 0.224444 }, { "epoch": 1.276964560862866, "grad_norm": 1.2493846416473389, "learning_rate": 8.267476767834117e-05, "loss": 1.8361167907714844, "memory(GiB)": 118.24, "step": 3315, "token_acc": 0.5765091249415067, "train_speed(iter/s)": 0.224539 }, { "epoch": 1.2788906009244991, "grad_norm": 0.8523443341255188, "learning_rate": 8.254912169511914e-05, "loss": 1.7843673706054688, "memory(GiB)": 118.24, "step": 3320, "token_acc": 0.6026341948310139, "train_speed(iter/s)": 0.224724 }, { "epoch": 1.2808166409861326, "grad_norm": 0.8983572125434875, "learning_rate": 8.242338532483114e-05, "loss": 1.8341567993164063, "memory(GiB)": 118.24, "step": 3325, "token_acc": 0.5868520859671302, "train_speed(iter/s)": 0.224374 }, { "epoch": 1.2827426810477658, "grad_norm": 0.8013198375701904, "learning_rate": 8.22975591343321e-05, "loss": 1.8846923828125, "memory(GiB)": 118.24, "step": 3330, "token_acc": 0.569195136074117, "train_speed(iter/s)": 0.224419 }, { "epoch": 1.284668721109399, "grad_norm": 1.0531998872756958, "learning_rate": 8.21716436908817e-05, "loss": 1.817266082763672, "memory(GiB)": 118.24, "step": 3335, "token_acc": 0.6099484379739157, "train_speed(iter/s)": 0.224314 }, { "epoch": 1.2865947611710324, "grad_norm": 1.8000037670135498, "learning_rate": 8.204563956214213e-05, "loss": 1.8082931518554688, "memory(GiB)": 118.24, "step": 3340, "token_acc": 0.5846994535519126, "train_speed(iter/s)": 0.224492 }, { "epoch": 1.2885208012326657, "grad_norm": 0.9103190302848816, "learning_rate": 8.191954731617539e-05, "loss": 1.818209457397461, "memory(GiB)": 118.24, "step": 3345, "token_acc": 0.5838716399249844, "train_speed(iter/s)": 0.22467 }, { "epoch": 1.2904468412942989, "grad_norm": 1.2308526039123535, "learning_rate": 8.179336752144064e-05, "loss": 1.7933704376220703, "memory(GiB)": 118.24, "step": 3350, "token_acc": 0.5789212030822769, "train_speed(iter/s)": 0.224667 }, { "epoch": 1.292372881355932, "grad_norm": 0.7987526655197144, "learning_rate": 8.166710074679183e-05, "loss": 1.793991470336914, "memory(GiB)": 118.24, "step": 3355, "token_acc": 0.6015644713600807, "train_speed(iter/s)": 0.224642 }, { "epoch": 1.2942989214175655, "grad_norm": 0.7937904000282288, "learning_rate": 8.1540747561475e-05, "loss": 1.7964553833007812, "memory(GiB)": 118.24, "step": 3360, "token_acc": 0.5679081489778773, "train_speed(iter/s)": 0.224515 }, { "epoch": 1.2962249614791987, "grad_norm": 1.6171221733093262, "learning_rate": 8.141430853512577e-05, "loss": 1.8486566543579102, "memory(GiB)": 118.24, "step": 3365, "token_acc": 0.5678276810265811, "train_speed(iter/s)": 0.224411 }, { "epoch": 1.2981510015408322, "grad_norm": 2.2579948902130127, "learning_rate": 8.128778423776675e-05, "loss": 1.801005744934082, "memory(GiB)": 118.24, "step": 3370, "token_acc": 0.5769160750045512, "train_speed(iter/s)": 0.22434 }, { "epoch": 1.3000770416024654, "grad_norm": 1.528611421585083, "learning_rate": 8.116117523980496e-05, "loss": 1.8592164993286133, "memory(GiB)": 118.24, "step": 3375, "token_acc": 0.5700712589073634, "train_speed(iter/s)": 0.224519 }, { "epoch": 1.3020030816640986, "grad_norm": 0.7972738146781921, "learning_rate": 8.103448211202928e-05, "loss": 1.8083702087402345, "memory(GiB)": 118.24, "step": 3380, "token_acc": 0.5807228915662651, "train_speed(iter/s)": 0.224567 }, { "epoch": 1.3039291217257318, "grad_norm": 2.7372536659240723, "learning_rate": 8.090770542560789e-05, "loss": 1.8603469848632812, "memory(GiB)": 118.24, "step": 3385, "token_acc": 0.5610678999369351, "train_speed(iter/s)": 0.224324 }, { "epoch": 1.305855161787365, "grad_norm": 0.8049010038375854, "learning_rate": 8.078084575208567e-05, "loss": 1.8244970321655274, "memory(GiB)": 118.24, "step": 3390, "token_acc": 0.5591511936339523, "train_speed(iter/s)": 0.224503 }, { "epoch": 1.3077812018489985, "grad_norm": 1.2021806240081787, "learning_rate": 8.065390366338163e-05, "loss": 1.8759939193725585, "memory(GiB)": 118.24, "step": 3395, "token_acc": 0.5740784221648274, "train_speed(iter/s)": 0.224182 }, { "epoch": 1.3097072419106317, "grad_norm": 1.3137462139129639, "learning_rate": 8.052687973178627e-05, "loss": 1.836330032348633, "memory(GiB)": 118.24, "step": 3400, "token_acc": 0.57466732380483, "train_speed(iter/s)": 0.224363 }, { "epoch": 1.3116332819722651, "grad_norm": 0.8630958199501038, "learning_rate": 8.039977452995917e-05, "loss": 1.829033660888672, "memory(GiB)": 118.24, "step": 3405, "token_acc": 0.5744279311158292, "train_speed(iter/s)": 0.22454 }, { "epoch": 1.3135593220338984, "grad_norm": 0.9817216396331787, "learning_rate": 8.027258863092622e-05, "loss": 1.8231685638427735, "memory(GiB)": 118.24, "step": 3410, "token_acc": 0.5717054263565892, "train_speed(iter/s)": 0.224131 }, { "epoch": 1.3154853620955316, "grad_norm": 0.7684584259986877, "learning_rate": 8.014532260807713e-05, "loss": 1.821477508544922, "memory(GiB)": 118.24, "step": 3415, "token_acc": 0.5776882397381012, "train_speed(iter/s)": 0.224309 }, { "epoch": 1.3174114021571648, "grad_norm": 1.0724796056747437, "learning_rate": 8.001797703516286e-05, "loss": 1.8452959060668945, "memory(GiB)": 118.24, "step": 3420, "token_acc": 0.5700459714493105, "train_speed(iter/s)": 0.224042 }, { "epoch": 1.3193374422187982, "grad_norm": 1.0265575647354126, "learning_rate": 7.989055248629298e-05, "loss": 1.8105331420898438, "memory(GiB)": 118.24, "step": 3425, "token_acc": 0.5692111959287531, "train_speed(iter/s)": 0.22422 }, { "epoch": 1.3212634822804314, "grad_norm": 1.1323086023330688, "learning_rate": 7.97630495359331e-05, "loss": 1.8532070159912108, "memory(GiB)": 118.24, "step": 3430, "token_acc": 0.5917520741825281, "train_speed(iter/s)": 0.224006 }, { "epoch": 1.3231895223420647, "grad_norm": 0.768324077129364, "learning_rate": 7.963546875890228e-05, "loss": 1.8037132263183593, "memory(GiB)": 118.24, "step": 3435, "token_acc": 0.5945297504798465, "train_speed(iter/s)": 0.224184 }, { "epoch": 1.325115562403698, "grad_norm": 0.9906430244445801, "learning_rate": 7.950781073037049e-05, "loss": 1.865304183959961, "memory(GiB)": 118.24, "step": 3440, "token_acc": 0.5786896712520401, "train_speed(iter/s)": 0.22436 }, { "epoch": 1.3270416024653313, "grad_norm": 1.069547176361084, "learning_rate": 7.938007602585591e-05, "loss": 1.8258533477783203, "memory(GiB)": 118.24, "step": 3445, "token_acc": 0.5560128029263832, "train_speed(iter/s)": 0.224217 }, { "epoch": 1.3289676425269645, "grad_norm": 0.8275343179702759, "learning_rate": 7.925226522122246e-05, "loss": 1.7918359756469726, "memory(GiB)": 118.24, "step": 3450, "token_acc": 0.6055412068560695, "train_speed(iter/s)": 0.224389 }, { "epoch": 1.3308936825885977, "grad_norm": 1.1620420217514038, "learning_rate": 7.912437889267708e-05, "loss": 1.8342025756835938, "memory(GiB)": 118.24, "step": 3455, "token_acc": 0.5751736500112032, "train_speed(iter/s)": 0.224161 }, { "epoch": 1.3328197226502312, "grad_norm": 0.6291630268096924, "learning_rate": 7.899641761676723e-05, "loss": 1.8314617156982422, "memory(GiB)": 118.24, "step": 3460, "token_acc": 0.5737434770667399, "train_speed(iter/s)": 0.224341 }, { "epoch": 1.3347457627118644, "grad_norm": 1.1161185503005981, "learning_rate": 7.886838197037825e-05, "loss": 1.8586105346679687, "memory(GiB)": 118.24, "step": 3465, "token_acc": 0.590559261159569, "train_speed(iter/s)": 0.224514 }, { "epoch": 1.3366718027734976, "grad_norm": 1.0682084560394287, "learning_rate": 7.874027253073077e-05, "loss": 1.9026851654052734, "memory(GiB)": 118.24, "step": 3470, "token_acc": 0.5668541756815232, "train_speed(iter/s)": 0.224345 }, { "epoch": 1.338597842835131, "grad_norm": 0.7407890558242798, "learning_rate": 7.861208987537804e-05, "loss": 1.8539093017578125, "memory(GiB)": 118.24, "step": 3475, "token_acc": 0.5772066148635187, "train_speed(iter/s)": 0.224519 }, { "epoch": 1.3405238828967643, "grad_norm": 1.523796558380127, "learning_rate": 7.84838345822035e-05, "loss": 1.7979095458984375, "memory(GiB)": 118.24, "step": 3480, "token_acc": 0.5945652173913043, "train_speed(iter/s)": 0.224201 }, { "epoch": 1.3424499229583975, "grad_norm": 1.1976600885391235, "learning_rate": 7.835550722941795e-05, "loss": 1.8510868072509765, "memory(GiB)": 118.24, "step": 3485, "token_acc": 0.5923408112395196, "train_speed(iter/s)": 0.22437 }, { "epoch": 1.3443759630200307, "grad_norm": 2.799816608428955, "learning_rate": 7.822710839555713e-05, "loss": 1.8664752960205078, "memory(GiB)": 118.24, "step": 3490, "token_acc": 0.5889204545454545, "train_speed(iter/s)": 0.224072 }, { "epoch": 1.3463020030816641, "grad_norm": 6.8079023361206055, "learning_rate": 7.809863865947899e-05, "loss": 1.822733497619629, "memory(GiB)": 118.24, "step": 3495, "token_acc": 0.5768054575394025, "train_speed(iter/s)": 0.224248 }, { "epoch": 1.3482280431432974, "grad_norm": 1.1376867294311523, "learning_rate": 7.797009860036114e-05, "loss": 1.8381580352783202, "memory(GiB)": 118.24, "step": 3500, "token_acc": 0.5807765408634266, "train_speed(iter/s)": 0.224419 }, { "epoch": 1.3501540832049308, "grad_norm": 0.751111626625061, "learning_rate": 7.784148879769826e-05, "loss": 1.8117263793945313, "memory(GiB)": 118.24, "step": 3505, "token_acc": 0.5783826223501701, "train_speed(iter/s)": 0.224158 }, { "epoch": 1.352080123266564, "grad_norm": 1.092025876045227, "learning_rate": 7.771280983129938e-05, "loss": 1.8256870269775392, "memory(GiB)": 118.24, "step": 3510, "token_acc": 0.5822851153039832, "train_speed(iter/s)": 0.224326 }, { "epoch": 1.3540061633281972, "grad_norm": 0.7541021704673767, "learning_rate": 7.758406228128547e-05, "loss": 1.8215415954589844, "memory(GiB)": 118.24, "step": 3515, "token_acc": 0.5863351150360214, "train_speed(iter/s)": 0.224019 }, { "epoch": 1.3559322033898304, "grad_norm": 1.833341360092163, "learning_rate": 7.745524672808651e-05, "loss": 1.824519157409668, "memory(GiB)": 118.24, "step": 3520, "token_acc": 0.5911068148864186, "train_speed(iter/s)": 0.224193 }, { "epoch": 1.3578582434514637, "grad_norm": 2.483410358428955, "learning_rate": 7.732636375243922e-05, "loss": 1.8503372192382812, "memory(GiB)": 118.24, "step": 3525, "token_acc": 0.5966494845360825, "train_speed(iter/s)": 0.224367 }, { "epoch": 1.359784283513097, "grad_norm": 1.4958441257476807, "learning_rate": 7.719741393538418e-05, "loss": 1.825875473022461, "memory(GiB)": 118.24, "step": 3530, "token_acc": 0.5801710901513489, "train_speed(iter/s)": 0.224068 }, { "epoch": 1.3617103235747303, "grad_norm": 1.3598182201385498, "learning_rate": 7.706839785826336e-05, "loss": 1.8679914474487305, "memory(GiB)": 118.24, "step": 3535, "token_acc": 0.5606219794074385, "train_speed(iter/s)": 0.224239 }, { "epoch": 1.3636363636363638, "grad_norm": 1.0903713703155518, "learning_rate": 7.693931610271746e-05, "loss": 1.809415626525879, "memory(GiB)": 118.24, "step": 3540, "token_acc": 0.5881499395405079, "train_speed(iter/s)": 0.223918 }, { "epoch": 1.365562403697997, "grad_norm": 1.1144036054611206, "learning_rate": 7.681016925068323e-05, "loss": 1.8281490325927734, "memory(GiB)": 118.24, "step": 3545, "token_acc": 0.5709703287890938, "train_speed(iter/s)": 0.224085 }, { "epoch": 1.3674884437596302, "grad_norm": 0.9303693175315857, "learning_rate": 7.668095788439087e-05, "loss": 1.8484193801879882, "memory(GiB)": 118.24, "step": 3550, "token_acc": 0.5805003207184093, "train_speed(iter/s)": 0.223815 }, { "epoch": 1.3694144838212634, "grad_norm": 1.2538106441497803, "learning_rate": 7.655168258636154e-05, "loss": 1.8071859359741211, "memory(GiB)": 118.24, "step": 3555, "token_acc": 0.5666938331975007, "train_speed(iter/s)": 0.22399 }, { "epoch": 1.3713405238828968, "grad_norm": 1.1651560068130493, "learning_rate": 7.642234393940453e-05, "loss": 1.7916452407836914, "memory(GiB)": 118.24, "step": 3560, "token_acc": 0.6053254437869823, "train_speed(iter/s)": 0.22416 }, { "epoch": 1.37326656394453, "grad_norm": 1.2316945791244507, "learning_rate": 7.629294252661477e-05, "loss": 1.842620277404785, "memory(GiB)": 118.24, "step": 3565, "token_acc": 0.5796603701583667, "train_speed(iter/s)": 0.223916 }, { "epoch": 1.3751926040061633, "grad_norm": 0.6773806810379028, "learning_rate": 7.616347893137009e-05, "loss": 1.8143430709838868, "memory(GiB)": 118.24, "step": 3570, "token_acc": 0.578386605783866, "train_speed(iter/s)": 0.224086 }, { "epoch": 1.3771186440677967, "grad_norm": 0.8631386160850525, "learning_rate": 7.603395373732875e-05, "loss": 1.7666091918945312, "memory(GiB)": 118.24, "step": 3575, "token_acc": 0.5911386593204775, "train_speed(iter/s)": 0.223819 }, { "epoch": 1.37904468412943, "grad_norm": 0.6786922216415405, "learning_rate": 7.590436752842662e-05, "loss": 1.8526723861694336, "memory(GiB)": 118.24, "step": 3580, "token_acc": 0.6015222194942303, "train_speed(iter/s)": 0.223991 }, { "epoch": 1.3809707241910631, "grad_norm": 0.79050612449646, "learning_rate": 7.577472088887473e-05, "loss": 1.8294553756713867, "memory(GiB)": 118.24, "step": 3585, "token_acc": 0.5710337202874516, "train_speed(iter/s)": 0.224163 }, { "epoch": 1.3828967642526964, "grad_norm": 0.5673639178276062, "learning_rate": 7.564501440315648e-05, "loss": 1.8349960327148438, "memory(GiB)": 118.24, "step": 3590, "token_acc": 0.5788113695090439, "train_speed(iter/s)": 0.223792 }, { "epoch": 1.3848228043143298, "grad_norm": 0.7228362560272217, "learning_rate": 7.551524865602512e-05, "loss": 1.7876060485839844, "memory(GiB)": 118.24, "step": 3595, "token_acc": 0.5683976560921399, "train_speed(iter/s)": 0.223964 }, { "epoch": 1.386748844375963, "grad_norm": 0.9439152479171753, "learning_rate": 7.538542423250104e-05, "loss": 1.8183494567871095, "memory(GiB)": 118.24, "step": 3600, "token_acc": 0.5827472072817542, "train_speed(iter/s)": 0.223706 }, { "epoch": 1.3886748844375962, "grad_norm": 1.1151697635650635, "learning_rate": 7.525554171786915e-05, "loss": 1.8112590789794922, "memory(GiB)": 118.24, "step": 3605, "token_acc": 0.5951767735893233, "train_speed(iter/s)": 0.223872 }, { "epoch": 1.3906009244992297, "grad_norm": 0.9838011264801025, "learning_rate": 7.51256016976763e-05, "loss": 1.837855911254883, "memory(GiB)": 118.24, "step": 3610, "token_acc": 0.5710779300470444, "train_speed(iter/s)": 0.22358 }, { "epoch": 1.392526964560863, "grad_norm": 1.9302595853805542, "learning_rate": 7.499560475772852e-05, "loss": 1.8453802108764648, "memory(GiB)": 118.24, "step": 3615, "token_acc": 0.5730688935281837, "train_speed(iter/s)": 0.223745 }, { "epoch": 1.394453004622496, "grad_norm": 1.1173580884933472, "learning_rate": 7.486555148408853e-05, "loss": 1.8429244995117187, "memory(GiB)": 118.24, "step": 3620, "token_acc": 0.5922043010752688, "train_speed(iter/s)": 0.223912 }, { "epoch": 1.3963790446841293, "grad_norm": 0.8065545558929443, "learning_rate": 7.473544246307297e-05, "loss": 1.8583301544189452, "memory(GiB)": 118.24, "step": 3625, "token_acc": 0.5653939886271324, "train_speed(iter/s)": 0.223769 }, { "epoch": 1.3983050847457628, "grad_norm": 1.9409068822860718, "learning_rate": 7.460527828124979e-05, "loss": 1.7476036071777343, "memory(GiB)": 118.24, "step": 3630, "token_acc": 0.5707927087749046, "train_speed(iter/s)": 0.223937 }, { "epoch": 1.400231124807396, "grad_norm": 1.1709771156311035, "learning_rate": 7.447505952543565e-05, "loss": 1.793610191345215, "memory(GiB)": 118.24, "step": 3635, "token_acc": 0.588042970574498, "train_speed(iter/s)": 0.223667 }, { "epoch": 1.4021571648690292, "grad_norm": 0.6994560360908508, "learning_rate": 7.434478678269324e-05, "loss": 1.7944747924804687, "memory(GiB)": 118.24, "step": 3640, "token_acc": 0.5730129390018485, "train_speed(iter/s)": 0.223834 }, { "epoch": 1.4040832049306626, "grad_norm": 1.1161283254623413, "learning_rate": 7.421446064032865e-05, "loss": 1.8786045074462892, "memory(GiB)": 118.24, "step": 3645, "token_acc": 0.5576496674057649, "train_speed(iter/s)": 0.224002 }, { "epoch": 1.4060092449922958, "grad_norm": 0.9730678200721741, "learning_rate": 7.408408168588868e-05, "loss": 1.8084569931030274, "memory(GiB)": 118.24, "step": 3650, "token_acc": 0.616824644549763, "train_speed(iter/s)": 0.223751 }, { "epoch": 1.407935285053929, "grad_norm": 0.6398198008537292, "learning_rate": 7.395365050715823e-05, "loss": 1.834469985961914, "memory(GiB)": 118.24, "step": 3655, "token_acc": 0.5976509150505327, "train_speed(iter/s)": 0.223915 }, { "epoch": 1.4098613251155623, "grad_norm": 1.075709342956543, "learning_rate": 7.382316769215767e-05, "loss": 1.8275850296020508, "memory(GiB)": 118.24, "step": 3660, "token_acc": 0.5840770314701738, "train_speed(iter/s)": 0.223818 }, { "epoch": 1.4117873651771957, "grad_norm": 1.401357650756836, "learning_rate": 7.369263382914015e-05, "loss": 1.8152078628540038, "memory(GiB)": 118.24, "step": 3665, "token_acc": 0.5861759425493717, "train_speed(iter/s)": 0.223983 }, { "epoch": 1.413713405238829, "grad_norm": 1.6760005950927734, "learning_rate": 7.35620495065889e-05, "loss": 1.8125579833984375, "memory(GiB)": 118.24, "step": 3670, "token_acc": 0.5612711476909008, "train_speed(iter/s)": 0.223672 }, { "epoch": 1.4156394453004624, "grad_norm": 1.07817804813385, "learning_rate": 7.343141531321474e-05, "loss": 1.8047115325927734, "memory(GiB)": 118.24, "step": 3675, "token_acc": 0.5848544647261964, "train_speed(iter/s)": 0.223836 }, { "epoch": 1.4175654853620956, "grad_norm": 1.3136463165283203, "learning_rate": 7.330073183795321e-05, "loss": 1.8179817199707031, "memory(GiB)": 118.24, "step": 3680, "token_acc": 0.5842886675436948, "train_speed(iter/s)": 0.223998 }, { "epoch": 1.4194915254237288, "grad_norm": 0.6776313185691833, "learning_rate": 7.316999966996216e-05, "loss": 1.8441036224365235, "memory(GiB)": 118.24, "step": 3685, "token_acc": 0.5781990521327014, "train_speed(iter/s)": 0.22379 }, { "epoch": 1.421417565485362, "grad_norm": 0.8565744757652283, "learning_rate": 7.303921939861882e-05, "loss": 1.8648609161376952, "memory(GiB)": 118.24, "step": 3690, "token_acc": 0.5672235481304694, "train_speed(iter/s)": 0.223955 }, { "epoch": 1.4233436055469955, "grad_norm": 0.7837241888046265, "learning_rate": 7.290839161351737e-05, "loss": 1.8636650085449218, "memory(GiB)": 118.24, "step": 3695, "token_acc": 0.5752885624344176, "train_speed(iter/s)": 0.223582 }, { "epoch": 1.4252696456086287, "grad_norm": 0.861605703830719, "learning_rate": 7.277751690446615e-05, "loss": 1.8081920623779297, "memory(GiB)": 118.24, "step": 3700, "token_acc": 0.569410486280902, "train_speed(iter/s)": 0.22375 }, { "epoch": 1.427195685670262, "grad_norm": 1.1699762344360352, "learning_rate": 7.264659586148512e-05, "loss": 1.7875905990600587, "memory(GiB)": 118.24, "step": 3705, "token_acc": 0.5894225855901891, "train_speed(iter/s)": 0.223914 }, { "epoch": 1.4291217257318953, "grad_norm": 0.8197382092475891, "learning_rate": 7.251562907480304e-05, "loss": 1.8165103912353515, "memory(GiB)": 118.24, "step": 3710, "token_acc": 0.5899446494464945, "train_speed(iter/s)": 0.223467 }, { "epoch": 1.4310477657935285, "grad_norm": 1.119502305984497, "learning_rate": 7.238461713485491e-05, "loss": 1.8033952713012695, "memory(GiB)": 118.24, "step": 3715, "token_acc": 0.5838014981273408, "train_speed(iter/s)": 0.223631 }, { "epoch": 1.4329738058551618, "grad_norm": 0.7231950759887695, "learning_rate": 7.225356063227934e-05, "loss": 1.8534526824951172, "memory(GiB)": 118.24, "step": 3720, "token_acc": 0.5901639344262295, "train_speed(iter/s)": 0.223631 }, { "epoch": 1.434899845916795, "grad_norm": 0.6805221438407898, "learning_rate": 7.212246015791585e-05, "loss": 1.823033332824707, "memory(GiB)": 118.24, "step": 3725, "token_acc": 0.5860956292167792, "train_speed(iter/s)": 0.223795 }, { "epoch": 1.4368258859784284, "grad_norm": 1.6532373428344727, "learning_rate": 7.199131630280212e-05, "loss": 1.8163490295410156, "memory(GiB)": 118.24, "step": 3730, "token_acc": 0.57074395253309, "train_speed(iter/s)": 0.223578 }, { "epoch": 1.4387519260400616, "grad_norm": 0.8490932583808899, "learning_rate": 7.186012965817143e-05, "loss": 1.863621139526367, "memory(GiB)": 118.24, "step": 3735, "token_acc": 0.5782407407407407, "train_speed(iter/s)": 0.223736 }, { "epoch": 1.4406779661016949, "grad_norm": 0.9240019917488098, "learning_rate": 7.172890081545e-05, "loss": 1.838235092163086, "memory(GiB)": 118.24, "step": 3740, "token_acc": 0.5957372466806429, "train_speed(iter/s)": 0.223894 }, { "epoch": 1.4426040061633283, "grad_norm": 0.7089791297912598, "learning_rate": 7.159763036625428e-05, "loss": 1.7420970916748046, "memory(GiB)": 118.24, "step": 3745, "token_acc": 0.5895997960744328, "train_speed(iter/s)": 0.223694 }, { "epoch": 1.4445300462249615, "grad_norm": 1.2524844408035278, "learning_rate": 7.146631890238828e-05, "loss": 1.8006404876708983, "memory(GiB)": 118.24, "step": 3750, "token_acc": 0.5788431933142731, "train_speed(iter/s)": 0.223857 }, { "epoch": 1.4464560862865947, "grad_norm": 0.9933207631111145, "learning_rate": 7.133496701584096e-05, "loss": 1.8426431655883788, "memory(GiB)": 118.24, "step": 3755, "token_acc": 0.5983285453120919, "train_speed(iter/s)": 0.223631 }, { "epoch": 1.448382126348228, "grad_norm": 1.5586143732070923, "learning_rate": 7.120357529878341e-05, "loss": 1.8038496017456054, "memory(GiB)": 118.24, "step": 3760, "token_acc": 0.5678546141137597, "train_speed(iter/s)": 0.223791 }, { "epoch": 1.4503081664098614, "grad_norm": 1.0300601720809937, "learning_rate": 7.107214434356638e-05, "loss": 1.7585687637329102, "memory(GiB)": 118.24, "step": 3765, "token_acc": 0.5792090395480226, "train_speed(iter/s)": 0.22395 }, { "epoch": 1.4522342064714946, "grad_norm": 1.08930242061615, "learning_rate": 7.094067474271752e-05, "loss": 1.8514856338500976, "memory(GiB)": 118.24, "step": 3770, "token_acc": 0.590959697172122, "train_speed(iter/s)": 0.223671 }, { "epoch": 1.4541602465331278, "grad_norm": 2.7024083137512207, "learning_rate": 7.080916708893865e-05, "loss": 1.8160589218139649, "memory(GiB)": 118.24, "step": 3775, "token_acc": 0.5636192271442035, "train_speed(iter/s)": 0.223835 }, { "epoch": 1.4560862865947612, "grad_norm": 1.2765828371047974, "learning_rate": 7.06776219751032e-05, "loss": 1.8457393646240234, "memory(GiB)": 118.24, "step": 3780, "token_acc": 0.5682948891904116, "train_speed(iter/s)": 0.223561 }, { "epoch": 1.4580123266563945, "grad_norm": 0.8677070736885071, "learning_rate": 7.054603999425342e-05, "loss": 1.7986244201660155, "memory(GiB)": 118.24, "step": 3785, "token_acc": 0.5850661625708885, "train_speed(iter/s)": 0.223722 }, { "epoch": 1.4599383667180277, "grad_norm": 0.8453196883201599, "learning_rate": 7.04144217395978e-05, "loss": 1.8284860610961915, "memory(GiB)": 118.24, "step": 3790, "token_acc": 0.5859569648924122, "train_speed(iter/s)": 0.223478 }, { "epoch": 1.461864406779661, "grad_norm": 1.015557885169983, "learning_rate": 7.02827678045084e-05, "loss": 1.8364437103271485, "memory(GiB)": 118.24, "step": 3795, "token_acc": 0.5993773946360154, "train_speed(iter/s)": 0.22363 }, { "epoch": 1.4637904468412943, "grad_norm": 1.7438759803771973, "learning_rate": 7.015107878251805e-05, "loss": 1.774271583557129, "memory(GiB)": 118.24, "step": 3800, "token_acc": 0.5734016484740476, "train_speed(iter/s)": 0.223791 }, { "epoch": 1.4657164869029276, "grad_norm": 0.8605408668518066, "learning_rate": 7.001935526731784e-05, "loss": 1.8239732742309571, "memory(GiB)": 118.24, "step": 3805, "token_acc": 0.5945497630331753, "train_speed(iter/s)": 0.223408 }, { "epoch": 1.467642526964561, "grad_norm": 2.304865598678589, "learning_rate": 6.988759785275433e-05, "loss": 1.7899288177490233, "memory(GiB)": 118.24, "step": 3810, "token_acc": 0.6034602076124568, "train_speed(iter/s)": 0.223563 }, { "epoch": 1.4695685670261942, "grad_norm": 1.3854377269744873, "learning_rate": 6.97558071328269e-05, "loss": 1.8322067260742188, "memory(GiB)": 118.24, "step": 3815, "token_acc": 0.5869630519675578, "train_speed(iter/s)": 0.223282 }, { "epoch": 1.4714946070878274, "grad_norm": 0.7945308685302734, "learning_rate": 6.96239837016851e-05, "loss": 1.825433349609375, "memory(GiB)": 118.24, "step": 3820, "token_acc": 0.5654494981849242, "train_speed(iter/s)": 0.22344 }, { "epoch": 1.4734206471494606, "grad_norm": 2.0651774406433105, "learning_rate": 6.949212815362594e-05, "loss": 1.850387954711914, "memory(GiB)": 118.24, "step": 3825, "token_acc": 0.5795557570262919, "train_speed(iter/s)": 0.223598 }, { "epoch": 1.4753466872110939, "grad_norm": 1.0030419826507568, "learning_rate": 6.936024108309125e-05, "loss": 1.7984760284423829, "memory(GiB)": 118.24, "step": 3830, "token_acc": 0.5759725960362124, "train_speed(iter/s)": 0.223502 }, { "epoch": 1.4772727272727273, "grad_norm": 0.8452328443527222, "learning_rate": 6.922832308466492e-05, "loss": 1.846176528930664, "memory(GiB)": 118.24, "step": 3835, "token_acc": 0.572118286059143, "train_speed(iter/s)": 0.223661 }, { "epoch": 1.4791987673343605, "grad_norm": 0.8833498358726501, "learning_rate": 6.909637475307032e-05, "loss": 1.8553993225097656, "memory(GiB)": 118.24, "step": 3840, "token_acc": 0.5760393873085339, "train_speed(iter/s)": 0.223519 }, { "epoch": 1.481124807395994, "grad_norm": 0.9554951786994934, "learning_rate": 6.896439668316754e-05, "loss": 1.822835922241211, "memory(GiB)": 118.24, "step": 3845, "token_acc": 0.5748560460652591, "train_speed(iter/s)": 0.223676 }, { "epoch": 1.4830508474576272, "grad_norm": 0.9319162368774414, "learning_rate": 6.883238946995072e-05, "loss": 1.7554649353027343, "memory(GiB)": 118.24, "step": 3850, "token_acc": 0.6158998252766453, "train_speed(iter/s)": 0.223486 }, { "epoch": 1.4849768875192604, "grad_norm": 0.7295608520507812, "learning_rate": 6.870035370854549e-05, "loss": 1.803689193725586, "memory(GiB)": 118.24, "step": 3855, "token_acc": 0.5767782841291856, "train_speed(iter/s)": 0.223639 }, { "epoch": 1.4869029275808936, "grad_norm": 0.6170604228973389, "learning_rate": 6.856828999420606e-05, "loss": 1.8226484298706054, "memory(GiB)": 118.24, "step": 3860, "token_acc": 0.575970977379428, "train_speed(iter/s)": 0.223797 }, { "epoch": 1.488828967642527, "grad_norm": 1.4971683025360107, "learning_rate": 6.843619892231268e-05, "loss": 1.8372892379760741, "memory(GiB)": 118.24, "step": 3865, "token_acc": 0.5786862003780718, "train_speed(iter/s)": 0.223536 }, { "epoch": 1.4907550077041603, "grad_norm": 0.8652157187461853, "learning_rate": 6.830408108836903e-05, "loss": 1.7618188858032227, "memory(GiB)": 118.24, "step": 3870, "token_acc": 0.6116504854368932, "train_speed(iter/s)": 0.223697 }, { "epoch": 1.4926810477657935, "grad_norm": 0.7496504783630371, "learning_rate": 6.817193708799933e-05, "loss": 1.8382587432861328, "memory(GiB)": 118.24, "step": 3875, "token_acc": 0.564877259239277, "train_speed(iter/s)": 0.223253 }, { "epoch": 1.494607087827427, "grad_norm": 0.9220601916313171, "learning_rate": 6.803976751694582e-05, "loss": 1.8546356201171874, "memory(GiB)": 118.24, "step": 3880, "token_acc": 0.571156692746881, "train_speed(iter/s)": 0.223408 }, { "epoch": 1.4965331278890601, "grad_norm": 0.7417863011360168, "learning_rate": 6.790757297106602e-05, "loss": 1.802634048461914, "memory(GiB)": 118.24, "step": 3885, "token_acc": 0.5866625691456668, "train_speed(iter/s)": 0.223567 }, { "epoch": 1.4984591679506933, "grad_norm": 0.9604321122169495, "learning_rate": 6.777535404633001e-05, "loss": 1.8321372985839843, "memory(GiB)": 118.24, "step": 3890, "token_acc": 0.6075491209927611, "train_speed(iter/s)": 0.223175 }, { "epoch": 1.5003852080123266, "grad_norm": 1.0275555849075317, "learning_rate": 6.764311133881782e-05, "loss": 1.800084686279297, "memory(GiB)": 118.24, "step": 3895, "token_acc": 0.5742320819112628, "train_speed(iter/s)": 0.223328 }, { "epoch": 1.50231124807396, "grad_norm": 0.9112734794616699, "learning_rate": 6.751084544471669e-05, "loss": 1.7598453521728517, "memory(GiB)": 118.24, "step": 3900, "token_acc": 0.5997248968363136, "train_speed(iter/s)": 0.223206 }, { "epoch": 1.5042372881355932, "grad_norm": 2.0053160190582275, "learning_rate": 6.737855696031835e-05, "loss": 1.8199298858642579, "memory(GiB)": 118.24, "step": 3905, "token_acc": 0.5812690134724033, "train_speed(iter/s)": 0.223297 }, { "epoch": 1.5061633281972266, "grad_norm": 2.413304328918457, "learning_rate": 6.724624648201641e-05, "loss": 1.7942798614501954, "memory(GiB)": 118.24, "step": 3910, "token_acc": 0.5803246910588805, "train_speed(iter/s)": 0.223143 }, { "epoch": 1.5080893682588599, "grad_norm": 1.2519792318344116, "learning_rate": 6.711391460630366e-05, "loss": 1.794654083251953, "memory(GiB)": 118.24, "step": 3915, "token_acc": 0.590481038432171, "train_speed(iter/s)": 0.223299 }, { "epoch": 1.510015408320493, "grad_norm": 0.7496642470359802, "learning_rate": 6.698156192976932e-05, "loss": 1.820594024658203, "memory(GiB)": 118.24, "step": 3920, "token_acc": 0.5823251999179824, "train_speed(iter/s)": 0.223425 }, { "epoch": 1.5119414483821263, "grad_norm": 0.6488379240036011, "learning_rate": 6.684918904909636e-05, "loss": 1.7711185455322265, "memory(GiB)": 118.24, "step": 3925, "token_acc": 0.5854161298634373, "train_speed(iter/s)": 0.223271 }, { "epoch": 1.5138674884437595, "grad_norm": 0.6287446618080139, "learning_rate": 6.671679656105887e-05, "loss": 1.8201759338378907, "memory(GiB)": 118.24, "step": 3930, "token_acc": 0.5729193842942865, "train_speed(iter/s)": 0.223398 }, { "epoch": 1.515793528505393, "grad_norm": 1.0703041553497314, "learning_rate": 6.658438506251936e-05, "loss": 1.795046615600586, "memory(GiB)": 118.24, "step": 3935, "token_acc": 0.5691599539700806, "train_speed(iter/s)": 0.223165 }, { "epoch": 1.5177195685670262, "grad_norm": 0.8465911149978638, "learning_rate": 6.645195515042601e-05, "loss": 1.7988338470458984, "memory(GiB)": 118.24, "step": 3940, "token_acc": 0.5716981132075472, "train_speed(iter/s)": 0.223318 }, { "epoch": 1.5196456086286596, "grad_norm": 0.9418315887451172, "learning_rate": 6.631950742181e-05, "loss": 1.8301557540893554, "memory(GiB)": 118.24, "step": 3945, "token_acc": 0.5683256010122312, "train_speed(iter/s)": 0.223469 }, { "epoch": 1.5215716486902928, "grad_norm": 0.7098641395568848, "learning_rate": 6.618704247378288e-05, "loss": 1.808327865600586, "memory(GiB)": 118.24, "step": 3950, "token_acc": 0.5765514279579128, "train_speed(iter/s)": 0.223226 }, { "epoch": 1.523497688751926, "grad_norm": 2.7469899654388428, "learning_rate": 6.605456090353379e-05, "loss": 1.8220361709594726, "memory(GiB)": 118.24, "step": 3955, "token_acc": 0.5714612918002748, "train_speed(iter/s)": 0.223336 }, { "epoch": 1.5254237288135593, "grad_norm": 0.906548798084259, "learning_rate": 6.592206330832681e-05, "loss": 1.7978946685791015, "memory(GiB)": 118.24, "step": 3960, "token_acc": 0.5825361785626686, "train_speed(iter/s)": 0.22302 }, { "epoch": 1.5273497688751925, "grad_norm": 0.6986387968063354, "learning_rate": 6.578955028549828e-05, "loss": 1.8580524444580078, "memory(GiB)": 118.24, "step": 3965, "token_acc": 0.5950443786982249, "train_speed(iter/s)": 0.223171 }, { "epoch": 1.529275808936826, "grad_norm": 0.9410300254821777, "learning_rate": 6.56570224324541e-05, "loss": 1.8048225402832032, "memory(GiB)": 118.24, "step": 3970, "token_acc": 0.5865906623235614, "train_speed(iter/s)": 0.222901 }, { "epoch": 1.5312018489984591, "grad_norm": 0.9247927665710449, "learning_rate": 6.5524480346667e-05, "loss": 1.828157615661621, "memory(GiB)": 118.24, "step": 3975, "token_acc": 0.5807531380753138, "train_speed(iter/s)": 0.223054 }, { "epoch": 1.5331278890600926, "grad_norm": 0.5807234048843384, "learning_rate": 6.53919246256739e-05, "loss": 1.7655223846435546, "memory(GiB)": 118.24, "step": 3980, "token_acc": 0.5690470266235382, "train_speed(iter/s)": 0.223204 }, { "epoch": 1.5350539291217258, "grad_norm": 0.7462795376777649, "learning_rate": 6.525935586707319e-05, "loss": 1.8265541076660157, "memory(GiB)": 118.24, "step": 3985, "token_acc": 0.5957257346393589, "train_speed(iter/s)": 0.222975 }, { "epoch": 1.536979969183359, "grad_norm": 0.9380358457565308, "learning_rate": 6.5126774668522e-05, "loss": 1.8238748550415038, "memory(GiB)": 118.24, "step": 3990, "token_acc": 0.5750702529104778, "train_speed(iter/s)": 0.223127 }, { "epoch": 1.5389060092449922, "grad_norm": 1.2271819114685059, "learning_rate": 6.49941816277336e-05, "loss": 1.8019058227539062, "memory(GiB)": 118.24, "step": 3995, "token_acc": 0.5838189152846257, "train_speed(iter/s)": 0.222916 }, { "epoch": 1.5408320493066254, "grad_norm": 1.2185630798339844, "learning_rate": 6.486157734247461e-05, "loss": 1.8059097290039063, "memory(GiB)": 118.24, "step": 4000, "token_acc": 0.5705741626794258, "train_speed(iter/s)": 0.223071 }, { "epoch": 1.5427580893682589, "grad_norm": 0.8724796772003174, "learning_rate": 6.472896241056236e-05, "loss": 1.7723880767822267, "memory(GiB)": 118.24, "step": 4005, "token_acc": 0.6481288981288982, "train_speed(iter/s)": 0.221989 }, { "epoch": 1.5446841294298923, "grad_norm": 0.9546380639076233, "learning_rate": 6.459633742986217e-05, "loss": 1.8220291137695312, "memory(GiB)": 118.24, "step": 4010, "token_acc": 0.5860163382988948, "train_speed(iter/s)": 0.222137 }, { "epoch": 1.5466101694915255, "grad_norm": 0.7918930053710938, "learning_rate": 6.446370299828465e-05, "loss": 1.821142578125, "memory(GiB)": 118.24, "step": 4015, "token_acc": 0.5894054054054054, "train_speed(iter/s)": 0.22229 }, { "epoch": 1.5485362095531587, "grad_norm": 0.8845969438552856, "learning_rate": 6.433105971378306e-05, "loss": 1.7757440567016602, "memory(GiB)": 118.24, "step": 4020, "token_acc": 0.5863309352517986, "train_speed(iter/s)": 0.222439 }, { "epoch": 1.550462249614792, "grad_norm": 0.8936904072761536, "learning_rate": 6.41984081743505e-05, "loss": 1.8229129791259766, "memory(GiB)": 131.93, "step": 4025, "token_acc": 0.5717443729903537, "train_speed(iter/s)": 0.222543 }, { "epoch": 1.5523882896764252, "grad_norm": 1.8596059083938599, "learning_rate": 6.406574897801739e-05, "loss": 1.8074674606323242, "memory(GiB)": 131.93, "step": 4030, "token_acc": 0.5809238949817215, "train_speed(iter/s)": 0.222289 }, { "epoch": 1.5543143297380584, "grad_norm": 1.0437047481536865, "learning_rate": 6.393308272284855e-05, "loss": 1.7794158935546875, "memory(GiB)": 131.93, "step": 4035, "token_acc": 0.589622641509434, "train_speed(iter/s)": 0.222438 }, { "epoch": 1.5562403697996918, "grad_norm": 1.4879014492034912, "learning_rate": 6.38004100069407e-05, "loss": 1.8027093887329102, "memory(GiB)": 131.93, "step": 4040, "token_acc": 0.5775363993529004, "train_speed(iter/s)": 0.222586 }, { "epoch": 1.5581664098613253, "grad_norm": 0.862655520439148, "learning_rate": 6.36677314284197e-05, "loss": 1.8362937927246095, "memory(GiB)": 131.93, "step": 4045, "token_acc": 0.5806672760511883, "train_speed(iter/s)": 0.222309 }, { "epoch": 1.5600924499229585, "grad_norm": 1.5662386417388916, "learning_rate": 6.353504758543777e-05, "loss": 1.7975168228149414, "memory(GiB)": 131.93, "step": 4050, "token_acc": 0.5845424933372816, "train_speed(iter/s)": 0.222458 }, { "epoch": 1.5620184899845917, "grad_norm": 1.3671258687973022, "learning_rate": 6.340235907617091e-05, "loss": 1.8101303100585937, "memory(GiB)": 131.93, "step": 4055, "token_acc": 0.5825965565379246, "train_speed(iter/s)": 0.222194 }, { "epoch": 1.563944530046225, "grad_norm": 1.1299470663070679, "learning_rate": 6.326966649881613e-05, "loss": 1.780502700805664, "memory(GiB)": 131.93, "step": 4060, "token_acc": 0.5811097992916174, "train_speed(iter/s)": 0.222347 }, { "epoch": 1.5658705701078581, "grad_norm": 1.2680153846740723, "learning_rate": 6.313697045158885e-05, "loss": 1.79473876953125, "memory(GiB)": 131.93, "step": 4065, "token_acc": 0.5804911323328786, "train_speed(iter/s)": 0.222494 }, { "epoch": 1.5677966101694916, "grad_norm": 0.9676305055618286, "learning_rate": 6.300427153272006e-05, "loss": 1.8003368377685547, "memory(GiB)": 131.93, "step": 4070, "token_acc": 0.5807224106964678, "train_speed(iter/s)": 0.222272 }, { "epoch": 1.5697226502311248, "grad_norm": 0.7961211800575256, "learning_rate": 6.287157034045371e-05, "loss": 1.8583356857299804, "memory(GiB)": 131.93, "step": 4075, "token_acc": 0.5850395850395851, "train_speed(iter/s)": 0.222421 }, { "epoch": 1.5716486902927582, "grad_norm": 0.9799847602844238, "learning_rate": 6.2738867473044e-05, "loss": 1.8402521133422851, "memory(GiB)": 131.93, "step": 4080, "token_acc": 0.5914113510798593, "train_speed(iter/s)": 0.2224 }, { "epoch": 1.5735747303543914, "grad_norm": 1.205005407333374, "learning_rate": 6.26061635287527e-05, "loss": 1.8169498443603516, "memory(GiB)": 131.93, "step": 4085, "token_acc": 0.5942886544893233, "train_speed(iter/s)": 0.22233 }, { "epoch": 1.5755007704160247, "grad_norm": 2.520035743713379, "learning_rate": 6.247345910584645e-05, "loss": 1.8226825714111328, "memory(GiB)": 131.93, "step": 4090, "token_acc": 0.5723228995057661, "train_speed(iter/s)": 0.222294 }, { "epoch": 1.5774268104776579, "grad_norm": 2.071319580078125, "learning_rate": 6.234075480259397e-05, "loss": 1.8224838256835938, "memory(GiB)": 131.93, "step": 4095, "token_acc": 0.5953954866651471, "train_speed(iter/s)": 0.222272 }, { "epoch": 1.579352850539291, "grad_norm": 1.01857590675354, "learning_rate": 6.220805121726354e-05, "loss": 1.8347482681274414, "memory(GiB)": 131.93, "step": 4100, "token_acc": 0.5785667324128863, "train_speed(iter/s)": 0.222422 }, { "epoch": 1.5812788906009245, "grad_norm": 1.273715615272522, "learning_rate": 6.207534894812013e-05, "loss": 1.7838895797729493, "memory(GiB)": 131.93, "step": 4105, "token_acc": 0.5911742328176516, "train_speed(iter/s)": 0.222437 }, { "epoch": 1.5832049306625577, "grad_norm": 0.6911029815673828, "learning_rate": 6.19426485934228e-05, "loss": 1.764463233947754, "memory(GiB)": 131.93, "step": 4110, "token_acc": 0.5801031124689708, "train_speed(iter/s)": 0.222381 }, { "epoch": 1.5851309707241912, "grad_norm": 1.2148245573043823, "learning_rate": 6.180995075142201e-05, "loss": 1.8277225494384766, "memory(GiB)": 131.93, "step": 4115, "token_acc": 0.595609756097561, "train_speed(iter/s)": 0.222423 }, { "epoch": 1.5870570107858244, "grad_norm": 0.6363925337791443, "learning_rate": 6.167725602035681e-05, "loss": 1.806521224975586, "memory(GiB)": 131.93, "step": 4120, "token_acc": 0.5807007466973004, "train_speed(iter/s)": 0.222437 }, { "epoch": 1.5889830508474576, "grad_norm": 0.7358555793762207, "learning_rate": 6.154456499845234e-05, "loss": 1.812693214416504, "memory(GiB)": 131.93, "step": 4125, "token_acc": 0.5861892583120205, "train_speed(iter/s)": 0.222584 }, { "epoch": 1.5909090909090908, "grad_norm": 0.742152214050293, "learning_rate": 6.141187828391695e-05, "loss": 1.7563091278076173, "memory(GiB)": 131.93, "step": 4130, "token_acc": 0.5806530812668794, "train_speed(iter/s)": 0.222364 }, { "epoch": 1.592835130970724, "grad_norm": 1.2658886909484863, "learning_rate": 6.127919647493952e-05, "loss": 1.7521839141845703, "memory(GiB)": 131.93, "step": 4135, "token_acc": 0.612416964741952, "train_speed(iter/s)": 0.22251 }, { "epoch": 1.5947611710323575, "grad_norm": 0.7957227230072021, "learning_rate": 6.114652016968692e-05, "loss": 1.7864873886108399, "memory(GiB)": 131.93, "step": 4140, "token_acc": 0.5793151642208246, "train_speed(iter/s)": 0.222519 }, { "epoch": 1.596687211093991, "grad_norm": 0.8658797740936279, "learning_rate": 6.101384996630115e-05, "loss": 1.7663434982299804, "memory(GiB)": 131.93, "step": 4145, "token_acc": 0.5923976608187135, "train_speed(iter/s)": 0.22245 }, { "epoch": 1.5986132511556241, "grad_norm": 0.9087325930595398, "learning_rate": 6.088118646289672e-05, "loss": 1.8283920288085938, "memory(GiB)": 131.93, "step": 4150, "token_acc": 0.5819885476314419, "train_speed(iter/s)": 0.222484 }, { "epoch": 1.6005392912172574, "grad_norm": 1.0251250267028809, "learning_rate": 6.074853025755793e-05, "loss": 1.785375213623047, "memory(GiB)": 131.93, "step": 4155, "token_acc": 0.6091557962096973, "train_speed(iter/s)": 0.222297 }, { "epoch": 1.6024653312788906, "grad_norm": 0.7247350811958313, "learning_rate": 6.061588194833613e-05, "loss": 1.7961769104003906, "memory(GiB)": 131.93, "step": 4160, "token_acc": 0.6086206896551725, "train_speed(iter/s)": 0.222444 }, { "epoch": 1.6043913713405238, "grad_norm": 0.8560896515846252, "learning_rate": 6.0483242133247165e-05, "loss": 1.7945735931396485, "memory(GiB)": 131.93, "step": 4165, "token_acc": 0.5805125725338491, "train_speed(iter/s)": 0.22226 }, { "epoch": 1.606317411402157, "grad_norm": 0.9486813545227051, "learning_rate": 6.03506114102685e-05, "loss": 1.7756511688232421, "memory(GiB)": 131.93, "step": 4170, "token_acc": 0.6003756260434057, "train_speed(iter/s)": 0.22235 }, { "epoch": 1.6082434514637904, "grad_norm": 0.7898660898208618, "learning_rate": 6.0217990377336696e-05, "loss": 1.8145938873291017, "memory(GiB)": 131.93, "step": 4175, "token_acc": 0.5748299319727891, "train_speed(iter/s)": 0.222495 }, { "epoch": 1.6101694915254239, "grad_norm": 0.9416387677192688, "learning_rate": 6.0085379632344554e-05, "loss": 1.788579559326172, "memory(GiB)": 131.93, "step": 4180, "token_acc": 0.5826525708793849, "train_speed(iter/s)": 0.222229 }, { "epoch": 1.612095531587057, "grad_norm": 1.1776823997497559, "learning_rate": 5.9952779773138486e-05, "loss": 1.748293685913086, "memory(GiB)": 131.93, "step": 4185, "token_acc": 0.6081560283687943, "train_speed(iter/s)": 0.222374 }, { "epoch": 1.6140215716486903, "grad_norm": 1.0704883337020874, "learning_rate": 5.9820191397515905e-05, "loss": 1.7967437744140624, "memory(GiB)": 131.93, "step": 4190, "token_acc": 0.5724153810729911, "train_speed(iter/s)": 0.222177 }, { "epoch": 1.6159476117103235, "grad_norm": 0.9205157160758972, "learning_rate": 5.968761510322239e-05, "loss": 1.7944927215576172, "memory(GiB)": 131.93, "step": 4195, "token_acc": 0.5637065637065637, "train_speed(iter/s)": 0.22232 }, { "epoch": 1.6178736517719567, "grad_norm": 0.9326324462890625, "learning_rate": 5.9555051487949105e-05, "loss": 1.7719268798828125, "memory(GiB)": 131.93, "step": 4200, "token_acc": 0.5736491487786824, "train_speed(iter/s)": 0.222462 }, { "epoch": 1.6197996918335902, "grad_norm": 2.1880314350128174, "learning_rate": 5.9422501149329976e-05, "loss": 1.7750030517578126, "memory(GiB)": 131.93, "step": 4205, "token_acc": 0.5857284440039643, "train_speed(iter/s)": 0.222237 }, { "epoch": 1.6217257318952234, "grad_norm": 3.239443063735962, "learning_rate": 5.928996468493914e-05, "loss": 1.7912681579589844, "memory(GiB)": 131.93, "step": 4210, "token_acc": 0.5949332606919095, "train_speed(iter/s)": 0.222378 }, { "epoch": 1.6236517719568568, "grad_norm": 1.9870812892913818, "learning_rate": 5.9157442692288185e-05, "loss": 1.80904541015625, "memory(GiB)": 131.93, "step": 4215, "token_acc": 0.5568037303942348, "train_speed(iter/s)": 0.222309 }, { "epoch": 1.62557781201849, "grad_norm": 0.6898970603942871, "learning_rate": 5.902493576882339e-05, "loss": 1.7626707077026367, "memory(GiB)": 131.93, "step": 4220, "token_acc": 0.6142458100558659, "train_speed(iter/s)": 0.222454 }, { "epoch": 1.6275038520801233, "grad_norm": 1.079793930053711, "learning_rate": 5.8892444511923206e-05, "loss": 1.814253807067871, "memory(GiB)": 131.93, "step": 4225, "token_acc": 0.5744269538801436, "train_speed(iter/s)": 0.222286 }, { "epoch": 1.6294298921417565, "grad_norm": 0.9346707463264465, "learning_rate": 5.875996951889534e-05, "loss": 1.783027458190918, "memory(GiB)": 131.93, "step": 4230, "token_acc": 0.5825401142235518, "train_speed(iter/s)": 0.222303 }, { "epoch": 1.6313559322033897, "grad_norm": 1.503077507019043, "learning_rate": 5.8627511386974236e-05, "loss": 1.7727964401245118, "memory(GiB)": 131.93, "step": 4235, "token_acc": 0.5837714285714286, "train_speed(iter/s)": 0.222321 }, { "epoch": 1.6332819722650231, "grad_norm": 0.903336226940155, "learning_rate": 5.849507071331837e-05, "loss": 1.820734977722168, "memory(GiB)": 131.93, "step": 4240, "token_acc": 0.5954816709292413, "train_speed(iter/s)": 0.222173 }, { "epoch": 1.6352080123266564, "grad_norm": 1.2855417728424072, "learning_rate": 5.836264809500738e-05, "loss": 1.8200553894042968, "memory(GiB)": 131.93, "step": 4245, "token_acc": 0.5963172804532578, "train_speed(iter/s)": 0.222317 }, { "epoch": 1.6371340523882898, "grad_norm": 0.736555278301239, "learning_rate": 5.823024412903964e-05, "loss": 1.8265460968017577, "memory(GiB)": 131.93, "step": 4250, "token_acc": 0.5576419213973799, "train_speed(iter/s)": 0.222026 }, { "epoch": 1.639060092449923, "grad_norm": 1.4227923154830933, "learning_rate": 5.8097859412329384e-05, "loss": 1.8268001556396485, "memory(GiB)": 131.93, "step": 4255, "token_acc": 0.5727906976744186, "train_speed(iter/s)": 0.222169 }, { "epoch": 1.6409861325115562, "grad_norm": 0.7862352132797241, "learning_rate": 5.7965494541704e-05, "loss": 1.8067546844482423, "memory(GiB)": 131.93, "step": 4260, "token_acc": 0.5549690153775534, "train_speed(iter/s)": 0.222065 }, { "epoch": 1.6429121725731894, "grad_norm": 0.9263100028038025, "learning_rate": 5.783315011390153e-05, "loss": 1.7670814514160156, "memory(GiB)": 131.93, "step": 4265, "token_acc": 0.5933734939759037, "train_speed(iter/s)": 0.222018 }, { "epoch": 1.6448382126348227, "grad_norm": 1.193380355834961, "learning_rate": 5.770082672556773e-05, "loss": 1.7904739379882812, "memory(GiB)": 131.93, "step": 4270, "token_acc": 0.5779981965734896, "train_speed(iter/s)": 0.22216 }, { "epoch": 1.646764252696456, "grad_norm": 0.9289668798446655, "learning_rate": 5.7568524973253604e-05, "loss": 1.8009286880493165, "memory(GiB)": 131.93, "step": 4275, "token_acc": 0.5754556500607534, "train_speed(iter/s)": 0.221855 }, { "epoch": 1.6486902927580893, "grad_norm": 0.7809291481971741, "learning_rate": 5.743624545341257e-05, "loss": 1.8702423095703125, "memory(GiB)": 131.93, "step": 4280, "token_acc": 0.5695433598659405, "train_speed(iter/s)": 0.221999 }, { "epoch": 1.6506163328197228, "grad_norm": 0.8659862279891968, "learning_rate": 5.730398876239779e-05, "loss": 1.7787857055664062, "memory(GiB)": 131.93, "step": 4285, "token_acc": 0.6093607305936073, "train_speed(iter/s)": 0.221986 }, { "epoch": 1.652542372881356, "grad_norm": 1.1571357250213623, "learning_rate": 5.7171755496459547e-05, "loss": 1.8045421600341798, "memory(GiB)": 131.93, "step": 4290, "token_acc": 0.5736395406889665, "train_speed(iter/s)": 0.221934 }, { "epoch": 1.6544684129429892, "grad_norm": 1.1856229305267334, "learning_rate": 5.7039546251742516e-05, "loss": 1.7755361557006837, "memory(GiB)": 131.93, "step": 4295, "token_acc": 0.5821543105074515, "train_speed(iter/s)": 0.222076 }, { "epoch": 1.6563944530046224, "grad_norm": 0.9358320236206055, "learning_rate": 5.690736162428306e-05, "loss": 1.813473892211914, "memory(GiB)": 131.93, "step": 4300, "token_acc": 0.5949001683906664, "train_speed(iter/s)": 0.22177 }, { "epoch": 1.6583204930662556, "grad_norm": 0.7613824009895325, "learning_rate": 5.6775202210006576e-05, "loss": 1.7764060974121094, "memory(GiB)": 131.93, "step": 4305, "token_acc": 0.5889128869690424, "train_speed(iter/s)": 0.221909 }, { "epoch": 1.660246533127889, "grad_norm": 0.9480492472648621, "learning_rate": 5.6643068604724765e-05, "loss": 1.8144424438476563, "memory(GiB)": 131.93, "step": 4310, "token_acc": 0.5799785292538916, "train_speed(iter/s)": 0.221692 }, { "epoch": 1.6621725731895225, "grad_norm": 1.0819952487945557, "learning_rate": 5.651096140413301e-05, "loss": 1.8126239776611328, "memory(GiB)": 131.93, "step": 4315, "token_acc": 0.5771992818671454, "train_speed(iter/s)": 0.221834 }, { "epoch": 1.6640986132511557, "grad_norm": 1.6762322187423706, "learning_rate": 5.637888120380761e-05, "loss": 1.798700714111328, "memory(GiB)": 131.93, "step": 4320, "token_acc": 0.5753484320557491, "train_speed(iter/s)": 0.221869 }, { "epoch": 1.666024653312789, "grad_norm": 0.7827457189559937, "learning_rate": 5.6246828599203224e-05, "loss": 1.7523693084716796, "memory(GiB)": 131.93, "step": 4325, "token_acc": 0.6039861351819757, "train_speed(iter/s)": 0.221795 }, { "epoch": 1.6679506933744221, "grad_norm": 1.329595923423767, "learning_rate": 5.611480418565001e-05, "loss": 1.779517364501953, "memory(GiB)": 131.93, "step": 4330, "token_acc": 0.5670757511637748, "train_speed(iter/s)": 0.221773 }, { "epoch": 1.6698767334360554, "grad_norm": 0.7551949620246887, "learning_rate": 5.598280855835104e-05, "loss": 1.7641143798828125, "memory(GiB)": 131.93, "step": 4335, "token_acc": 0.603670441233893, "train_speed(iter/s)": 0.221606 }, { "epoch": 1.6718027734976888, "grad_norm": 0.916948139667511, "learning_rate": 5.585084231237967e-05, "loss": 1.8208442687988282, "memory(GiB)": 131.93, "step": 4340, "token_acc": 0.5839048925468678, "train_speed(iter/s)": 0.221745 }, { "epoch": 1.673728813559322, "grad_norm": 0.811696469783783, "learning_rate": 5.571890604267678e-05, "loss": 1.7991548538208009, "memory(GiB)": 131.93, "step": 4345, "token_acc": 0.5771144278606966, "train_speed(iter/s)": 0.221768 }, { "epoch": 1.6756548536209555, "grad_norm": 0.9142571091651917, "learning_rate": 5.5587000344048034e-05, "loss": 1.792905044555664, "memory(GiB)": 131.93, "step": 4350, "token_acc": 0.5745149029805962, "train_speed(iter/s)": 0.221716 }, { "epoch": 1.6775808936825887, "grad_norm": 0.9663639068603516, "learning_rate": 5.5455125811161385e-05, "loss": 1.8136367797851562, "memory(GiB)": 131.93, "step": 4355, "token_acc": 0.5760583941605839, "train_speed(iter/s)": 0.221767 }, { "epoch": 1.6795069337442219, "grad_norm": 0.8619137406349182, "learning_rate": 5.53232830385442e-05, "loss": 1.7703617095947266, "memory(GiB)": 131.93, "step": 4360, "token_acc": 0.5875139353400223, "train_speed(iter/s)": 0.22158 }, { "epoch": 1.681432973805855, "grad_norm": 0.8836708068847656, "learning_rate": 5.519147262058072e-05, "loss": 1.757936668395996, "memory(GiB)": 131.93, "step": 4365, "token_acc": 0.6040394551432597, "train_speed(iter/s)": 0.22172 }, { "epoch": 1.6833590138674883, "grad_norm": 1.0510940551757812, "learning_rate": 5.505969515150927e-05, "loss": 1.7802169799804688, "memory(GiB)": 131.93, "step": 4370, "token_acc": 0.6055925432756325, "train_speed(iter/s)": 0.221399 }, { "epoch": 1.6852850539291218, "grad_norm": 0.8072844743728638, "learning_rate": 5.492795122541963e-05, "loss": 1.8022111892700194, "memory(GiB)": 131.93, "step": 4375, "token_acc": 0.6045744446888058, "train_speed(iter/s)": 0.221534 }, { "epoch": 1.687211093990755, "grad_norm": 1.3731038570404053, "learning_rate": 5.479624143625043e-05, "loss": 1.7882612228393555, "memory(GiB)": 131.93, "step": 4380, "token_acc": 0.5847626645392899, "train_speed(iter/s)": 0.221622 }, { "epoch": 1.6891371340523884, "grad_norm": 1.9726977348327637, "learning_rate": 5.4664566377786315e-05, "loss": 1.80009765625, "memory(GiB)": 131.93, "step": 4385, "token_acc": 0.6001899335232669, "train_speed(iter/s)": 0.221398 }, { "epoch": 1.6910631741140216, "grad_norm": 0.8724384307861328, "learning_rate": 5.4532926643655436e-05, "loss": 1.7494041442871093, "memory(GiB)": 131.93, "step": 4390, "token_acc": 0.5881465517241379, "train_speed(iter/s)": 0.221392 }, { "epoch": 1.6929892141756548, "grad_norm": 0.8237367868423462, "learning_rate": 5.4401322827326615e-05, "loss": 1.76648006439209, "memory(GiB)": 131.93, "step": 4395, "token_acc": 0.5902809765085214, "train_speed(iter/s)": 0.221276 }, { "epoch": 1.694915254237288, "grad_norm": 0.8389945030212402, "learning_rate": 5.4269755522106776e-05, "loss": 1.7597530364990235, "memory(GiB)": 131.93, "step": 4400, "token_acc": 0.5829567462879277, "train_speed(iter/s)": 0.221415 }, { "epoch": 1.6968412942989213, "grad_norm": 2.2436716556549072, "learning_rate": 5.4138225321138296e-05, "loss": 1.7983936309814452, "memory(GiB)": 131.93, "step": 4405, "token_acc": 0.5844823556905819, "train_speed(iter/s)": 0.221383 }, { "epoch": 1.6987673343605547, "grad_norm": 1.6652860641479492, "learning_rate": 5.400673281739615e-05, "loss": 1.7839183807373047, "memory(GiB)": 131.93, "step": 4410, "token_acc": 0.6086360520904729, "train_speed(iter/s)": 0.22131 }, { "epoch": 1.700693374422188, "grad_norm": 0.8282755017280579, "learning_rate": 5.387527860368552e-05, "loss": 1.791282844543457, "memory(GiB)": 131.93, "step": 4415, "token_acc": 0.5967122117847993, "train_speed(iter/s)": 0.221442 }, { "epoch": 1.7026194144838214, "grad_norm": 2.055833578109741, "learning_rate": 5.374386327263882e-05, "loss": 1.7740272521972655, "memory(GiB)": 131.93, "step": 4420, "token_acc": 0.5839515814135103, "train_speed(iter/s)": 0.221191 }, { "epoch": 1.7045454545454546, "grad_norm": 1.131196141242981, "learning_rate": 5.3612487416713254e-05, "loss": 1.794045639038086, "memory(GiB)": 131.93, "step": 4425, "token_acc": 0.5852143300890453, "train_speed(iter/s)": 0.221325 }, { "epoch": 1.7064714946070878, "grad_norm": 0.7844781279563904, "learning_rate": 5.348115162818807e-05, "loss": 1.7582126617431642, "memory(GiB)": 131.93, "step": 4430, "token_acc": 0.5810031069684864, "train_speed(iter/s)": 0.221206 }, { "epoch": 1.708397534668721, "grad_norm": 2.2037553787231445, "learning_rate": 5.3349856499161796e-05, "loss": 1.7799232482910157, "memory(GiB)": 131.93, "step": 4435, "token_acc": 0.5913784202374807, "train_speed(iter/s)": 0.22134 }, { "epoch": 1.7103235747303542, "grad_norm": 1.3611695766448975, "learning_rate": 5.3218602621549766e-05, "loss": 1.7474092483520507, "memory(GiB)": 131.93, "step": 4440, "token_acc": 0.5956314757770933, "train_speed(iter/s)": 0.221456 }, { "epoch": 1.7122496147919877, "grad_norm": 0.7552334666252136, "learning_rate": 5.308739058708127e-05, "loss": 1.862451171875, "memory(GiB)": 131.93, "step": 4445, "token_acc": 0.5797303579730358, "train_speed(iter/s)": 0.221259 }, { "epoch": 1.7141756548536211, "grad_norm": 0.9053819179534912, "learning_rate": 5.295622098729695e-05, "loss": 1.8101446151733398, "memory(GiB)": 131.93, "step": 4450, "token_acc": 0.5588153115395362, "train_speed(iter/s)": 0.221345 }, { "epoch": 1.7161016949152543, "grad_norm": 1.9687672853469849, "learning_rate": 5.282509441354622e-05, "loss": 1.7491125106811523, "memory(GiB)": 131.93, "step": 4455, "token_acc": 0.5920114122681883, "train_speed(iter/s)": 0.221101 }, { "epoch": 1.7180277349768875, "grad_norm": 1.2585374116897583, "learning_rate": 5.269401145698439e-05, "loss": 1.784451675415039, "memory(GiB)": 131.93, "step": 4460, "token_acc": 0.6034816247582205, "train_speed(iter/s)": 0.221236 }, { "epoch": 1.7199537750385208, "grad_norm": 0.7189536690711975, "learning_rate": 5.256297270857026e-05, "loss": 1.7744054794311523, "memory(GiB)": 131.93, "step": 4465, "token_acc": 0.5843681519357194, "train_speed(iter/s)": 0.221233 }, { "epoch": 1.721879815100154, "grad_norm": 0.9224844574928284, "learning_rate": 5.2431978759063285e-05, "loss": 1.8306072235107422, "memory(GiB)": 131.93, "step": 4470, "token_acc": 0.575031525851198, "train_speed(iter/s)": 0.221221 }, { "epoch": 1.7238058551617874, "grad_norm": 1.0133947134017944, "learning_rate": 5.230103019902088e-05, "loss": 1.8345813751220703, "memory(GiB)": 131.93, "step": 4475, "token_acc": 0.5722408891186354, "train_speed(iter/s)": 0.221244 }, { "epoch": 1.7257318952234206, "grad_norm": 0.7901082634925842, "learning_rate": 5.217012761879598e-05, "loss": 1.7997222900390626, "memory(GiB)": 131.93, "step": 4480, "token_acc": 0.5869781312127237, "train_speed(iter/s)": 0.22113 }, { "epoch": 1.727657935285054, "grad_norm": 2.8494746685028076, "learning_rate": 5.2039271608534066e-05, "loss": 1.8335643768310548, "memory(GiB)": 131.93, "step": 4485, "token_acc": 0.5937803692905733, "train_speed(iter/s)": 0.221266 }, { "epoch": 1.7295839753466873, "grad_norm": 0.9147348403930664, "learning_rate": 5.1908462758170784e-05, "loss": 1.7803791046142579, "memory(GiB)": 131.93, "step": 4490, "token_acc": 0.6080928126768534, "train_speed(iter/s)": 0.221085 }, { "epoch": 1.7315100154083205, "grad_norm": 2.125124931335449, "learning_rate": 5.1777701657429155e-05, "loss": 1.8200122833251953, "memory(GiB)": 131.93, "step": 4495, "token_acc": 0.5815688646904618, "train_speed(iter/s)": 0.221217 }, { "epoch": 1.7334360554699537, "grad_norm": 0.9141799211502075, "learning_rate": 5.164698889581686e-05, "loss": 1.796607208251953, "memory(GiB)": 131.93, "step": 4500, "token_acc": 0.5673546985334058, "train_speed(iter/s)": 0.221253 }, { "epoch": 1.735362095531587, "grad_norm": 1.0192279815673828, "learning_rate": 5.1516325062623736e-05, "loss": 1.7500907897949218, "memory(GiB)": 131.93, "step": 4505, "token_acc": 0.588645071403692, "train_speed(iter/s)": 0.221137 }, { "epoch": 1.7372881355932204, "grad_norm": 1.2992863655090332, "learning_rate": 5.1385710746918985e-05, "loss": 1.7655946731567382, "memory(GiB)": 131.93, "step": 4510, "token_acc": 0.6145015105740181, "train_speed(iter/s)": 0.221186 }, { "epoch": 1.7392141756548536, "grad_norm": 0.8210198283195496, "learning_rate": 5.125514653754863e-05, "loss": 1.79072265625, "memory(GiB)": 131.93, "step": 4515, "token_acc": 0.5870560034865984, "train_speed(iter/s)": 0.221149 }, { "epoch": 1.741140215716487, "grad_norm": 0.9174981117248535, "learning_rate": 5.112463302313273e-05, "loss": 1.7909740447998046, "memory(GiB)": 131.93, "step": 4520, "token_acc": 0.5924792304328815, "train_speed(iter/s)": 0.221281 }, { "epoch": 1.7430662557781202, "grad_norm": 0.9780272245407104, "learning_rate": 5.099417079206281e-05, "loss": 1.7749004364013672, "memory(GiB)": 131.93, "step": 4525, "token_acc": 0.5970764617691154, "train_speed(iter/s)": 0.221141 }, { "epoch": 1.7449922958397535, "grad_norm": 1.0628557205200195, "learning_rate": 5.086376043249924e-05, "loss": 1.757938766479492, "memory(GiB)": 131.93, "step": 4530, "token_acc": 0.5930714808489875, "train_speed(iter/s)": 0.221126 }, { "epoch": 1.7469183359013867, "grad_norm": 0.9142824411392212, "learning_rate": 5.0733402532368485e-05, "loss": 1.7809608459472657, "memory(GiB)": 131.93, "step": 4535, "token_acc": 0.6041095890410959, "train_speed(iter/s)": 0.221241 }, { "epoch": 1.74884437596302, "grad_norm": 2.513240098953247, "learning_rate": 5.060309767936058e-05, "loss": 1.8032955169677733, "memory(GiB)": 131.93, "step": 4540, "token_acc": 0.5804898471844254, "train_speed(iter/s)": 0.221034 }, { "epoch": 1.7507704160246533, "grad_norm": 1.0291776657104492, "learning_rate": 5.047284646092633e-05, "loss": 1.7572067260742188, "memory(GiB)": 131.93, "step": 4545, "token_acc": 0.5715598437858948, "train_speed(iter/s)": 0.221168 }, { "epoch": 1.7526964560862865, "grad_norm": 1.0176438093185425, "learning_rate": 5.034264946427475e-05, "loss": 1.7985729217529296, "memory(GiB)": 131.93, "step": 4550, "token_acc": 0.5937277263007841, "train_speed(iter/s)": 0.22088 }, { "epoch": 1.75462249614792, "grad_norm": 0.8897360563278198, "learning_rate": 5.02125072763705e-05, "loss": 1.8225889205932617, "memory(GiB)": 136.87, "step": 4555, "token_acc": 0.5959084084084084, "train_speed(iter/s)": 0.221008 }, { "epoch": 1.7565485362095532, "grad_norm": 1.406435489654541, "learning_rate": 5.0082420483931005e-05, "loss": 1.7655206680297852, "memory(GiB)": 136.87, "step": 4560, "token_acc": 0.5744073121965153, "train_speed(iter/s)": 0.221085 }, { "epoch": 1.7584745762711864, "grad_norm": 0.7303741574287415, "learning_rate": 4.995238967342408e-05, "loss": 1.8284893035888672, "memory(GiB)": 136.87, "step": 4565, "token_acc": 0.5793450881612091, "train_speed(iter/s)": 0.220843 }, { "epoch": 1.7604006163328196, "grad_norm": 0.9404786825180054, "learning_rate": 4.982241543106507e-05, "loss": 1.778439712524414, "memory(GiB)": 136.87, "step": 4570, "token_acc": 0.5836909871244635, "train_speed(iter/s)": 0.220918 }, { "epoch": 1.7623266563944529, "grad_norm": 1.1099157333374023, "learning_rate": 4.969249834281432e-05, "loss": 1.7675697326660156, "memory(GiB)": 136.87, "step": 4575, "token_acc": 0.5851723282915944, "train_speed(iter/s)": 0.220673 }, { "epoch": 1.7642526964560863, "grad_norm": 0.9159120321273804, "learning_rate": 4.956263899437456e-05, "loss": 1.7952730178833007, "memory(GiB)": 136.87, "step": 4580, "token_acc": 0.5858278765201123, "train_speed(iter/s)": 0.220802 }, { "epoch": 1.7661787365177197, "grad_norm": 1.147900104522705, "learning_rate": 4.943283797118811e-05, "loss": 1.8198644638061523, "memory(GiB)": 136.87, "step": 4585, "token_acc": 0.5881942830583314, "train_speed(iter/s)": 0.220899 }, { "epoch": 1.768104776579353, "grad_norm": 1.568490982055664, "learning_rate": 4.9303095858434457e-05, "loss": 1.7864479064941405, "memory(GiB)": 136.87, "step": 4590, "token_acc": 0.573892674616695, "train_speed(iter/s)": 0.220707 }, { "epoch": 1.7700308166409862, "grad_norm": 0.7823016047477722, "learning_rate": 4.917341324102742e-05, "loss": 1.817404556274414, "memory(GiB)": 136.87, "step": 4595, "token_acc": 0.5949966193373901, "train_speed(iter/s)": 0.220825 }, { "epoch": 1.7719568567026194, "grad_norm": 0.7892808318138123, "learning_rate": 4.904379070361261e-05, "loss": 1.7801900863647462, "memory(GiB)": 136.87, "step": 4600, "token_acc": 0.5884646962233169, "train_speed(iter/s)": 0.220509 }, { "epoch": 1.7738828967642526, "grad_norm": 0.9384677410125732, "learning_rate": 4.891422883056484e-05, "loss": 1.7853931427001952, "memory(GiB)": 136.87, "step": 4605, "token_acc": 0.6032745591939547, "train_speed(iter/s)": 0.220639 }, { "epoch": 1.775808936825886, "grad_norm": 1.1951448917388916, "learning_rate": 4.878472820598534e-05, "loss": 1.787259292602539, "memory(GiB)": 136.87, "step": 4610, "token_acc": 0.6066497604959143, "train_speed(iter/s)": 0.220293 }, { "epoch": 1.7777349768875192, "grad_norm": 0.680446982383728, "learning_rate": 4.865528941369927e-05, "loss": 1.7327657699584962, "memory(GiB)": 136.87, "step": 4615, "token_acc": 0.5866331447726797, "train_speed(iter/s)": 0.220421 }, { "epoch": 1.7796610169491527, "grad_norm": 0.9006595611572266, "learning_rate": 4.852591303725306e-05, "loss": 1.7611690521240235, "memory(GiB)": 136.87, "step": 4620, "token_acc": 0.5814180929095355, "train_speed(iter/s)": 0.220554 }, { "epoch": 1.781587057010786, "grad_norm": 3.494994640350342, "learning_rate": 4.8396599659911654e-05, "loss": 1.791965866088867, "memory(GiB)": 136.87, "step": 4625, "token_acc": 0.5826539855072463, "train_speed(iter/s)": 0.220356 }, { "epoch": 1.7835130970724191, "grad_norm": 0.6547976136207581, "learning_rate": 4.8267349864656096e-05, "loss": 1.8127758026123046, "memory(GiB)": 136.87, "step": 4630, "token_acc": 0.5715144230769231, "train_speed(iter/s)": 0.220486 }, { "epoch": 1.7854391371340523, "grad_norm": 0.7490419745445251, "learning_rate": 4.8138164234180704e-05, "loss": 1.729184341430664, "memory(GiB)": 136.87, "step": 4635, "token_acc": 0.6081560283687943, "train_speed(iter/s)": 0.220355 }, { "epoch": 1.7873651771956856, "grad_norm": 0.8735674023628235, "learning_rate": 4.800904335089052e-05, "loss": 1.7472841262817382, "memory(GiB)": 136.87, "step": 4640, "token_acc": 0.6201038225578103, "train_speed(iter/s)": 0.220487 }, { "epoch": 1.789291217257319, "grad_norm": 0.9173216223716736, "learning_rate": 4.7879987796898775e-05, "loss": 1.7994834899902343, "memory(GiB)": 136.87, "step": 4645, "token_acc": 0.5629775696327336, "train_speed(iter/s)": 0.220618 }, { "epoch": 1.7912172573189522, "grad_norm": 2.4372682571411133, "learning_rate": 4.775099815402405e-05, "loss": 1.761520004272461, "memory(GiB)": 136.87, "step": 4650, "token_acc": 0.5876243093922652, "train_speed(iter/s)": 0.220311 }, { "epoch": 1.7931432973805856, "grad_norm": 0.9179458022117615, "learning_rate": 4.7622075003787895e-05, "loss": 1.7844257354736328, "memory(GiB)": 136.87, "step": 4655, "token_acc": 0.5902473250306963, "train_speed(iter/s)": 0.22044 }, { "epoch": 1.7950693374422189, "grad_norm": 1.4642587900161743, "learning_rate": 4.749321892741204e-05, "loss": 1.7623058319091798, "memory(GiB)": 136.87, "step": 4660, "token_acc": 0.5580135440180587, "train_speed(iter/s)": 0.220267 }, { "epoch": 1.796995377503852, "grad_norm": 2.837496757507324, "learning_rate": 4.736443050581579e-05, "loss": 1.8073123931884765, "memory(GiB)": 136.87, "step": 4665, "token_acc": 0.5952567109721136, "train_speed(iter/s)": 0.220391 }, { "epoch": 1.7989214175654853, "grad_norm": 1.2552157640457153, "learning_rate": 4.7235710319613544e-05, "loss": 1.783104705810547, "memory(GiB)": 136.87, "step": 4670, "token_acc": 0.5611565531672056, "train_speed(iter/s)": 0.220176 }, { "epoch": 1.8008474576271185, "grad_norm": 1.5756300687789917, "learning_rate": 4.7107058949111964e-05, "loss": 1.794896125793457, "memory(GiB)": 136.87, "step": 4675, "token_acc": 0.5817132442284325, "train_speed(iter/s)": 0.220307 }, { "epoch": 1.802773497688752, "grad_norm": 0.7319515347480774, "learning_rate": 4.6978476974307554e-05, "loss": 1.821190643310547, "memory(GiB)": 136.87, "step": 4680, "token_acc": 0.590921087358142, "train_speed(iter/s)": 0.220438 }, { "epoch": 1.8046995377503852, "grad_norm": 1.2306523323059082, "learning_rate": 4.6849964974883946e-05, "loss": 1.7625011444091796, "memory(GiB)": 136.87, "step": 4685, "token_acc": 0.5788793103448275, "train_speed(iter/s)": 0.220291 }, { "epoch": 1.8066255778120186, "grad_norm": 1.4012212753295898, "learning_rate": 4.672152353020924e-05, "loss": 1.805426025390625, "memory(GiB)": 136.87, "step": 4690, "token_acc": 0.5921122286924299, "train_speed(iter/s)": 0.22039 }, { "epoch": 1.8085516178736518, "grad_norm": 1.441062331199646, "learning_rate": 4.659315321933356e-05, "loss": 1.8188335418701171, "memory(GiB)": 136.87, "step": 4695, "token_acc": 0.5558343789209536, "train_speed(iter/s)": 0.2202 }, { "epoch": 1.810477657935285, "grad_norm": 1.0652846097946167, "learning_rate": 4.646485462098625e-05, "loss": 1.7476085662841796, "memory(GiB)": 136.87, "step": 4700, "token_acc": 0.5936967632027257, "train_speed(iter/s)": 0.220326 }, { "epoch": 1.8124036979969183, "grad_norm": 1.1764566898345947, "learning_rate": 4.633662831357342e-05, "loss": 1.7230371475219726, "memory(GiB)": 136.87, "step": 4705, "token_acc": 0.5962368908081431, "train_speed(iter/s)": 0.220396 }, { "epoch": 1.8143297380585515, "grad_norm": 0.7621398568153381, "learning_rate": 4.6208474875175236e-05, "loss": 1.7616214752197266, "memory(GiB)": 136.87, "step": 4710, "token_acc": 0.586130168737252, "train_speed(iter/s)": 0.220282 }, { "epoch": 1.816255778120185, "grad_norm": 2.101602077484131, "learning_rate": 4.60803948835433e-05, "loss": 1.772210693359375, "memory(GiB)": 136.87, "step": 4715, "token_acc": 0.5930422600980622, "train_speed(iter/s)": 0.220335 }, { "epoch": 1.8181818181818183, "grad_norm": 1.008318305015564, "learning_rate": 4.595238891609822e-05, "loss": 1.7882339477539062, "memory(GiB)": 136.87, "step": 4720, "token_acc": 0.586574074074074, "train_speed(iter/s)": 0.220288 }, { "epoch": 1.8201078582434516, "grad_norm": 1.013633131980896, "learning_rate": 4.582445754992678e-05, "loss": 1.7856552124023437, "memory(GiB)": 136.87, "step": 4725, "token_acc": 0.6065536205316223, "train_speed(iter/s)": 0.220415 }, { "epoch": 1.8220338983050848, "grad_norm": 1.5142829418182373, "learning_rate": 4.5696601361779496e-05, "loss": 1.8153907775878906, "memory(GiB)": 136.87, "step": 4730, "token_acc": 0.5887063655030801, "train_speed(iter/s)": 0.220278 }, { "epoch": 1.823959938366718, "grad_norm": 0.6277472376823425, "learning_rate": 4.556882092806791e-05, "loss": 1.7784048080444337, "memory(GiB)": 136.87, "step": 4735, "token_acc": 0.5881290904987587, "train_speed(iter/s)": 0.220408 }, { "epoch": 1.8258859784283512, "grad_norm": 1.007671594619751, "learning_rate": 4.5441116824862075e-05, "loss": 1.803271484375, "memory(GiB)": 136.87, "step": 4740, "token_acc": 0.5730870712401055, "train_speed(iter/s)": 0.220295 }, { "epoch": 1.8278120184899846, "grad_norm": 2.1779470443725586, "learning_rate": 4.531348962788794e-05, "loss": 1.7714363098144532, "memory(GiB)": 136.87, "step": 4745, "token_acc": 0.5853403141361256, "train_speed(iter/s)": 0.220319 }, { "epoch": 1.8297380585516179, "grad_norm": 1.355035662651062, "learning_rate": 4.518593991252469e-05, "loss": 1.7307008743286132, "memory(GiB)": 136.87, "step": 4750, "token_acc": 0.5931807566557683, "train_speed(iter/s)": 0.220238 }, { "epoch": 1.8316640986132513, "grad_norm": 0.8230199813842773, "learning_rate": 4.5058468253802264e-05, "loss": 1.769505500793457, "memory(GiB)": 136.87, "step": 4755, "token_acc": 0.584516129032258, "train_speed(iter/s)": 0.220232 }, { "epoch": 1.8335901386748845, "grad_norm": 0.740838885307312, "learning_rate": 4.4931075226398624e-05, "loss": 1.7958070755004882, "memory(GiB)": 136.87, "step": 4760, "token_acc": 0.6033260632497274, "train_speed(iter/s)": 0.220358 }, { "epoch": 1.8355161787365177, "grad_norm": 0.7863432765007019, "learning_rate": 4.4803761404637295e-05, "loss": 1.771224021911621, "memory(GiB)": 136.87, "step": 4765, "token_acc": 0.5859081721051111, "train_speed(iter/s)": 0.220254 }, { "epoch": 1.837442218798151, "grad_norm": 0.7620553374290466, "learning_rate": 4.467652736248473e-05, "loss": 1.7881610870361329, "memory(GiB)": 136.87, "step": 4770, "token_acc": 0.5714818266542404, "train_speed(iter/s)": 0.22036 }, { "epoch": 1.8393682588597842, "grad_norm": 0.7606117129325867, "learning_rate": 4.454937367354766e-05, "loss": 1.745125961303711, "memory(GiB)": 136.87, "step": 4775, "token_acc": 0.5948275862068966, "train_speed(iter/s)": 0.220153 }, { "epoch": 1.8412942989214176, "grad_norm": 1.7403249740600586, "learning_rate": 4.442230091107062e-05, "loss": 1.8502304077148437, "memory(GiB)": 136.87, "step": 4780, "token_acc": 0.5819545554820207, "train_speed(iter/s)": 0.220277 }, { "epoch": 1.8432203389830508, "grad_norm": 0.8471406698226929, "learning_rate": 4.429530964793325e-05, "loss": 1.7093017578125, "memory(GiB)": 136.87, "step": 4785, "token_acc": 0.6070791953144894, "train_speed(iter/s)": 0.220402 }, { "epoch": 1.8451463790446843, "grad_norm": 0.8410062789916992, "learning_rate": 4.4168400456647804e-05, "loss": 1.765213966369629, "memory(GiB)": 136.87, "step": 4790, "token_acc": 0.5746051537822111, "train_speed(iter/s)": 0.220225 }, { "epoch": 1.8470724191063175, "grad_norm": 0.7389904260635376, "learning_rate": 4.4041573909356535e-05, "loss": 1.7936391830444336, "memory(GiB)": 136.87, "step": 4795, "token_acc": 0.5778757346767422, "train_speed(iter/s)": 0.220345 }, { "epoch": 1.8489984591679507, "grad_norm": 0.6481694579124451, "learning_rate": 4.391483057782908e-05, "loss": 1.7836284637451172, "memory(GiB)": 136.87, "step": 4800, "token_acc": 0.5902085222121487, "train_speed(iter/s)": 0.220186 }, { "epoch": 1.850924499229584, "grad_norm": 1.3757723569869995, "learning_rate": 4.3788171033459966e-05, "loss": 1.77281494140625, "memory(GiB)": 136.87, "step": 4805, "token_acc": 0.6181568088033013, "train_speed(iter/s)": 0.220312 }, { "epoch": 1.8528505392912171, "grad_norm": 0.9086828827857971, "learning_rate": 4.366159584726595e-05, "loss": 1.8004470825195313, "memory(GiB)": 136.87, "step": 4810, "token_acc": 0.6059182714889619, "train_speed(iter/s)": 0.220105 }, { "epoch": 1.8547765793528506, "grad_norm": 1.3315320014953613, "learning_rate": 4.353510558988346e-05, "loss": 1.7454950332641601, "memory(GiB)": 136.87, "step": 4815, "token_acc": 0.6055421686746988, "train_speed(iter/s)": 0.220231 }, { "epoch": 1.8567026194144838, "grad_norm": 0.9846578240394592, "learning_rate": 4.34087008315661e-05, "loss": 1.7798379898071288, "memory(GiB)": 136.87, "step": 4820, "token_acc": 0.5910478128179044, "train_speed(iter/s)": 0.220353 }, { "epoch": 1.8586286594761172, "grad_norm": 1.17121422290802, "learning_rate": 4.328238214218196e-05, "loss": 1.7810277938842773, "memory(GiB)": 136.87, "step": 4825, "token_acc": 0.5834919124643198, "train_speed(iter/s)": 0.220102 }, { "epoch": 1.8605546995377504, "grad_norm": 0.9881283044815063, "learning_rate": 4.315615009121115e-05, "loss": 1.7379592895507812, "memory(GiB)": 136.87, "step": 4830, "token_acc": 0.5831913685406019, "train_speed(iter/s)": 0.220228 }, { "epoch": 1.8624807395993837, "grad_norm": 1.1143995523452759, "learning_rate": 4.30300052477432e-05, "loss": 1.7863338470458985, "memory(GiB)": 136.87, "step": 4835, "token_acc": 0.5957777777777777, "train_speed(iter/s)": 0.220017 }, { "epoch": 1.8644067796610169, "grad_norm": 0.6762909889221191, "learning_rate": 4.290394818047438e-05, "loss": 1.7599510192871093, "memory(GiB)": 136.87, "step": 4840, "token_acc": 0.5778923253150057, "train_speed(iter/s)": 0.220143 }, { "epoch": 1.86633281972265, "grad_norm": 1.5299830436706543, "learning_rate": 4.277797945770539e-05, "loss": 1.75982608795166, "memory(GiB)": 136.87, "step": 4845, "token_acc": 0.5765464533078577, "train_speed(iter/s)": 0.220268 }, { "epoch": 1.8682588597842835, "grad_norm": 0.7435590624809265, "learning_rate": 4.265209964733853e-05, "loss": 1.85118408203125, "memory(GiB)": 136.87, "step": 4850, "token_acc": 0.5891848264729621, "train_speed(iter/s)": 0.219979 }, { "epoch": 1.870184899845917, "grad_norm": 1.0209436416625977, "learning_rate": 4.2526309316875355e-05, "loss": 1.786417579650879, "memory(GiB)": 136.87, "step": 4855, "token_acc": 0.5877367896311066, "train_speed(iter/s)": 0.220103 }, { "epoch": 1.8721109399075502, "grad_norm": 2.6529462337493896, "learning_rate": 4.2400609033413945e-05, "loss": 1.8036392211914063, "memory(GiB)": 136.87, "step": 4860, "token_acc": 0.5727710843373494, "train_speed(iter/s)": 0.219858 }, { "epoch": 1.8740369799691834, "grad_norm": 0.7397337555885315, "learning_rate": 4.227499936364641e-05, "loss": 1.7708890914916993, "memory(GiB)": 136.87, "step": 4865, "token_acc": 0.6290562667460554, "train_speed(iter/s)": 0.219983 }, { "epoch": 1.8759630200308166, "grad_norm": 0.8623694777488708, "learning_rate": 4.214948087385643e-05, "loss": 1.7600967407226562, "memory(GiB)": 136.87, "step": 4870, "token_acc": 0.6226290251433613, "train_speed(iter/s)": 0.219687 }, { "epoch": 1.8778890600924498, "grad_norm": 0.8745719790458679, "learning_rate": 4.2024054129916555e-05, "loss": 1.7324600219726562, "memory(GiB)": 136.87, "step": 4875, "token_acc": 0.6134807793575566, "train_speed(iter/s)": 0.219811 }, { "epoch": 1.879815100154083, "grad_norm": 0.9468375444412231, "learning_rate": 4.189871969728576e-05, "loss": 1.8063899993896484, "memory(GiB)": 136.87, "step": 4880, "token_acc": 0.5982632541133455, "train_speed(iter/s)": 0.219936 }, { "epoch": 1.8817411402157165, "grad_norm": 0.9925563335418701, "learning_rate": 4.177347814100681e-05, "loss": 1.7524160385131835, "memory(GiB)": 136.87, "step": 4885, "token_acc": 0.6023249526899161, "train_speed(iter/s)": 0.219596 }, { "epoch": 1.88366718027735, "grad_norm": 0.919121265411377, "learning_rate": 4.164833002570377e-05, "loss": 1.7760139465332032, "memory(GiB)": 136.87, "step": 4890, "token_acc": 0.5709849157054127, "train_speed(iter/s)": 0.219718 }, { "epoch": 1.8855932203389831, "grad_norm": 0.7400526404380798, "learning_rate": 4.15232759155795e-05, "loss": 1.808416748046875, "memory(GiB)": 136.87, "step": 4895, "token_acc": 0.5926333150082463, "train_speed(iter/s)": 0.219659 }, { "epoch": 1.8875192604006163, "grad_norm": 0.8366232514381409, "learning_rate": 4.1398316374412995e-05, "loss": 1.8037895202636718, "memory(GiB)": 136.87, "step": 4900, "token_acc": 0.5835567470956211, "train_speed(iter/s)": 0.219783 }, { "epoch": 1.8894453004622496, "grad_norm": 1.0510910749435425, "learning_rate": 4.1273451965556895e-05, "loss": 1.7811899185180664, "memory(GiB)": 136.87, "step": 4905, "token_acc": 0.6086859189612716, "train_speed(iter/s)": 0.219908 }, { "epoch": 1.8913713405238828, "grad_norm": 1.7145397663116455, "learning_rate": 4.114868325193503e-05, "loss": 1.7484718322753907, "memory(GiB)": 136.87, "step": 4910, "token_acc": 0.5782068965517242, "train_speed(iter/s)": 0.219745 }, { "epoch": 1.8932973805855162, "grad_norm": 2.069145917892456, "learning_rate": 4.102401079603974e-05, "loss": 1.8130809783935546, "memory(GiB)": 136.87, "step": 4915, "token_acc": 0.6018835616438356, "train_speed(iter/s)": 0.219866 }, { "epoch": 1.8952234206471494, "grad_norm": 1.0597784519195557, "learning_rate": 4.089943515992948e-05, "loss": 1.7761568069458007, "memory(GiB)": 136.87, "step": 4920, "token_acc": 0.5935516628585935, "train_speed(iter/s)": 0.21969 }, { "epoch": 1.8971494607087829, "grad_norm": 0.6227929592132568, "learning_rate": 4.077495690522613e-05, "loss": 1.7269193649291992, "memory(GiB)": 136.87, "step": 4925, "token_acc": 0.5961311630101439, "train_speed(iter/s)": 0.219815 }, { "epoch": 1.899075500770416, "grad_norm": 1.7546056509017944, "learning_rate": 4.065057659311259e-05, "loss": 1.7972156524658203, "memory(GiB)": 136.87, "step": 4930, "token_acc": 0.5876288659793815, "train_speed(iter/s)": 0.219503 }, { "epoch": 1.9010015408320493, "grad_norm": 0.6977673172950745, "learning_rate": 4.052629478433024e-05, "loss": 1.7847705841064454, "memory(GiB)": 136.87, "step": 4935, "token_acc": 0.5927557513460597, "train_speed(iter/s)": 0.219626 }, { "epoch": 1.9029275808936825, "grad_norm": 0.9524767994880676, "learning_rate": 4.0402112039176294e-05, "loss": 1.7926811218261718, "memory(GiB)": 136.87, "step": 4940, "token_acc": 0.5765542839467986, "train_speed(iter/s)": 0.219748 }, { "epoch": 1.9048536209553157, "grad_norm": 1.2936216592788696, "learning_rate": 4.027802891750146e-05, "loss": 1.7728578567504882, "memory(GiB)": 136.87, "step": 4945, "token_acc": 0.5909990108803165, "train_speed(iter/s)": 0.219572 }, { "epoch": 1.9067796610169492, "grad_norm": 0.7453409433364868, "learning_rate": 4.015404597870723e-05, "loss": 1.7843599319458008, "memory(GiB)": 136.87, "step": 4950, "token_acc": 0.6277190801740211, "train_speed(iter/s)": 0.219696 }, { "epoch": 1.9087057010785824, "grad_norm": 0.8125904202461243, "learning_rate": 4.0030163781743486e-05, "loss": 1.8140865325927735, "memory(GiB)": 136.87, "step": 4955, "token_acc": 0.5720982142857143, "train_speed(iter/s)": 0.219547 }, { "epoch": 1.9106317411402158, "grad_norm": 1.0446525812149048, "learning_rate": 3.990638288510595e-05, "loss": 1.7837417602539063, "memory(GiB)": 136.87, "step": 4960, "token_acc": 0.5729465824238943, "train_speed(iter/s)": 0.219669 }, { "epoch": 1.912557781201849, "grad_norm": 1.090869665145874, "learning_rate": 3.978270384683359e-05, "loss": 1.7389108657836914, "memory(GiB)": 136.87, "step": 4965, "token_acc": 0.5873891153200671, "train_speed(iter/s)": 0.219787 }, { "epoch": 1.9144838212634823, "grad_norm": 0.8425670266151428, "learning_rate": 3.965912722450628e-05, "loss": 1.7734956741333008, "memory(GiB)": 136.87, "step": 4970, "token_acc": 0.6196412283368805, "train_speed(iter/s)": 0.219583 }, { "epoch": 1.9164098613251155, "grad_norm": 0.9146763682365417, "learning_rate": 3.9535653575242056e-05, "loss": 1.7732589721679688, "memory(GiB)": 136.87, "step": 4975, "token_acc": 0.5751953125, "train_speed(iter/s)": 0.219701 }, { "epoch": 1.9183359013867487, "grad_norm": 2.2349743843078613, "learning_rate": 3.941228345569476e-05, "loss": 1.8016424179077148, "memory(GiB)": 136.87, "step": 4980, "token_acc": 0.5855096882898062, "train_speed(iter/s)": 0.219511 }, { "epoch": 1.9202619414483821, "grad_norm": 0.8929947018623352, "learning_rate": 3.9289017422051556e-05, "loss": 1.7526325225830077, "memory(GiB)": 136.87, "step": 4985, "token_acc": 0.6034209692746278, "train_speed(iter/s)": 0.219635 }, { "epoch": 1.9221879815100154, "grad_norm": 1.0452306270599365, "learning_rate": 3.916585603003027e-05, "loss": 1.7687679290771485, "memory(GiB)": 136.87, "step": 4990, "token_acc": 0.6074582924435721, "train_speed(iter/s)": 0.219537 }, { "epoch": 1.9241140215716488, "grad_norm": 0.8353390693664551, "learning_rate": 3.9042799834877024e-05, "loss": 1.7881763458251954, "memory(GiB)": 136.87, "step": 4995, "token_acc": 0.5752255547427457, "train_speed(iter/s)": 0.219654 }, { "epoch": 1.926040061633282, "grad_norm": 2.4853179454803467, "learning_rate": 3.89198493913637e-05, "loss": 1.7509956359863281, "memory(GiB)": 136.87, "step": 5000, "token_acc": 0.6059449140987183, "train_speed(iter/s)": 0.219774 }, { "epoch": 1.9279661016949152, "grad_norm": 1.1738383769989014, "learning_rate": 3.879700525378534e-05, "loss": 1.7904457092285155, "memory(GiB)": 136.87, "step": 5005, "token_acc": 0.6083260041043682, "train_speed(iter/s)": 0.21981 }, { "epoch": 1.9298921417565484, "grad_norm": 0.7832270860671997, "learning_rate": 3.867426797595784e-05, "loss": 1.816567611694336, "memory(GiB)": 136.87, "step": 5010, "token_acc": 0.5781649245063879, "train_speed(iter/s)": 0.219928 }, { "epoch": 1.9318181818181817, "grad_norm": 0.7609400153160095, "learning_rate": 3.855163811121523e-05, "loss": 1.77062931060791, "memory(GiB)": 136.87, "step": 5015, "token_acc": 0.5856014047410009, "train_speed(iter/s)": 0.219784 }, { "epoch": 1.933744221879815, "grad_norm": 0.8299560546875, "learning_rate": 3.842911621240739e-05, "loss": 1.6838603973388673, "memory(GiB)": 136.87, "step": 5020, "token_acc": 0.6017058671491341, "train_speed(iter/s)": 0.219906 }, { "epoch": 1.9356702619414485, "grad_norm": 0.7642867565155029, "learning_rate": 3.830670283189741e-05, "loss": 1.7932559967041015, "memory(GiB)": 136.87, "step": 5025, "token_acc": 0.5891627803686431, "train_speed(iter/s)": 0.220027 }, { "epoch": 1.9375963020030817, "grad_norm": 1.0746841430664062, "learning_rate": 3.8184398521559136e-05, "loss": 1.7707805633544922, "memory(GiB)": 136.87, "step": 5030, "token_acc": 0.5746116107931316, "train_speed(iter/s)": 0.219821 }, { "epoch": 1.939522342064715, "grad_norm": 0.9030567407608032, "learning_rate": 3.806220383277474e-05, "loss": 1.7698774337768555, "memory(GiB)": 136.87, "step": 5035, "token_acc": 0.5837050950927448, "train_speed(iter/s)": 0.219942 }, { "epoch": 1.9414483821263482, "grad_norm": 0.9361485242843628, "learning_rate": 3.794011931643213e-05, "loss": 1.8155391693115235, "memory(GiB)": 136.87, "step": 5040, "token_acc": 0.5655793025871766, "train_speed(iter/s)": 0.219775 }, { "epoch": 1.9433744221879814, "grad_norm": 0.6484358310699463, "learning_rate": 3.7818145522922606e-05, "loss": 1.7554157257080079, "memory(GiB)": 136.87, "step": 5045, "token_acc": 0.602027207255268, "train_speed(iter/s)": 0.219808 }, { "epoch": 1.9453004622496148, "grad_norm": 0.917418897151947, "learning_rate": 3.769628300213823e-05, "loss": 1.7940500259399415, "memory(GiB)": 136.87, "step": 5050, "token_acc": 0.5830508474576271, "train_speed(iter/s)": 0.219701 }, { "epoch": 1.947226502311248, "grad_norm": 0.8638196587562561, "learning_rate": 3.757453230346941e-05, "loss": 1.763375473022461, "memory(GiB)": 136.87, "step": 5055, "token_acc": 0.6080776173285198, "train_speed(iter/s)": 0.219692 }, { "epoch": 1.9491525423728815, "grad_norm": 0.9856778979301453, "learning_rate": 3.74528939758025e-05, "loss": 1.7669132232666016, "memory(GiB)": 136.87, "step": 5060, "token_acc": 0.6098901098901099, "train_speed(iter/s)": 0.219813 }, { "epoch": 1.9510785824345147, "grad_norm": 2.8649604320526123, "learning_rate": 3.733136856751717e-05, "loss": 1.7646055221557617, "memory(GiB)": 136.87, "step": 5065, "token_acc": 0.5865094598299972, "train_speed(iter/s)": 0.21978 }, { "epoch": 1.953004622496148, "grad_norm": 0.7658465504646301, "learning_rate": 3.7209956626484105e-05, "loss": 1.7879024505615235, "memory(GiB)": 136.87, "step": 5070, "token_acc": 0.5792602377807133, "train_speed(iter/s)": 0.21969 }, { "epoch": 1.9549306625577811, "grad_norm": 1.2134671211242676, "learning_rate": 3.7088658700062365e-05, "loss": 1.7850914001464844, "memory(GiB)": 136.87, "step": 5075, "token_acc": 0.601921274601687, "train_speed(iter/s)": 0.219808 }, { "epoch": 1.9568567026194144, "grad_norm": 0.6674994230270386, "learning_rate": 3.6967475335097035e-05, "loss": 1.6980182647705078, "memory(GiB)": 136.87, "step": 5080, "token_acc": 0.6125792811839323, "train_speed(iter/s)": 0.219741 }, { "epoch": 1.9587827426810478, "grad_norm": 0.7206431031227112, "learning_rate": 3.684640707791676e-05, "loss": 1.7626705169677734, "memory(GiB)": 136.87, "step": 5085, "token_acc": 0.6083462934162779, "train_speed(iter/s)": 0.219858 }, { "epoch": 1.960708782742681, "grad_norm": 0.767113447189331, "learning_rate": 3.6725454474331166e-05, "loss": 1.7204601287841796, "memory(GiB)": 136.87, "step": 5090, "token_acc": 0.6090700344431688, "train_speed(iter/s)": 0.219719 }, { "epoch": 1.9626348228043144, "grad_norm": 1.0114778280258179, "learning_rate": 3.660461806962856e-05, "loss": 1.7915451049804687, "memory(GiB)": 136.87, "step": 5095, "token_acc": 0.5886148882230928, "train_speed(iter/s)": 0.219836 }, { "epoch": 1.9645608628659477, "grad_norm": 1.0704529285430908, "learning_rate": 3.648389840857334e-05, "loss": 1.7517950057983398, "memory(GiB)": 136.87, "step": 5100, "token_acc": 0.6034829202947086, "train_speed(iter/s)": 0.21994 }, { "epoch": 1.9664869029275809, "grad_norm": 0.9311957955360413, "learning_rate": 3.636329603540361e-05, "loss": 1.7800918579101563, "memory(GiB)": 136.87, "step": 5105, "token_acc": 0.5909961685823755, "train_speed(iter/s)": 0.21991 }, { "epoch": 1.968412942989214, "grad_norm": 0.7079247832298279, "learning_rate": 3.6242811493828734e-05, "loss": 1.698584747314453, "memory(GiB)": 136.87, "step": 5110, "token_acc": 0.5861823361823362, "train_speed(iter/s)": 0.22003 }, { "epoch": 1.9703389830508473, "grad_norm": 0.7370250225067139, "learning_rate": 3.6122445327026785e-05, "loss": 1.7373451232910155, "memory(GiB)": 136.87, "step": 5115, "token_acc": 0.5903924512116663, "train_speed(iter/s)": 0.220016 }, { "epoch": 1.9722650231124808, "grad_norm": 0.8963513374328613, "learning_rate": 3.6002198077642266e-05, "loss": 1.8241622924804688, "memory(GiB)": 136.87, "step": 5120, "token_acc": 0.5881872618399564, "train_speed(iter/s)": 0.220134 }, { "epoch": 1.974191063174114, "grad_norm": 0.9271499514579773, "learning_rate": 3.588207028778349e-05, "loss": 1.7844337463378905, "memory(GiB)": 136.87, "step": 5125, "token_acc": 0.6064779393011986, "train_speed(iter/s)": 0.220154 }, { "epoch": 1.9761171032357474, "grad_norm": 0.8182199597358704, "learning_rate": 3.5762062499020215e-05, "loss": 1.7281490325927735, "memory(GiB)": 136.87, "step": 5130, "token_acc": 0.5673478356405186, "train_speed(iter/s)": 0.220273 }, { "epoch": 1.9780431432973806, "grad_norm": 1.1200106143951416, "learning_rate": 3.564217525238124e-05, "loss": 1.7470687866210937, "memory(GiB)": 136.87, "step": 5135, "token_acc": 0.5805084745762712, "train_speed(iter/s)": 0.220382 }, { "epoch": 1.9799691833590138, "grad_norm": 0.7583392858505249, "learning_rate": 3.5522409088351915e-05, "loss": 1.767685317993164, "memory(GiB)": 136.87, "step": 5140, "token_acc": 0.6013662849105887, "train_speed(iter/s)": 0.220441 }, { "epoch": 1.981895223420647, "grad_norm": 1.004130482673645, "learning_rate": 3.5402764546871746e-05, "loss": 1.7334518432617188, "memory(GiB)": 136.87, "step": 5145, "token_acc": 0.5674142820314514, "train_speed(iter/s)": 0.220562 }, { "epoch": 1.9838212634822803, "grad_norm": 0.855783998966217, "learning_rate": 3.528324216733186e-05, "loss": 1.7906742095947266, "memory(GiB)": 136.87, "step": 5150, "token_acc": 0.5893255917820456, "train_speed(iter/s)": 0.220681 }, { "epoch": 1.9857473035439137, "grad_norm": 1.9494175910949707, "learning_rate": 3.5163842488572655e-05, "loss": 1.7863471984863282, "memory(GiB)": 136.87, "step": 5155, "token_acc": 0.5960616006059076, "train_speed(iter/s)": 0.2208 }, { "epoch": 1.9876733436055471, "grad_norm": 0.6759247183799744, "learning_rate": 3.504456604888144e-05, "loss": 1.7436237335205078, "memory(GiB)": 136.87, "step": 5160, "token_acc": 0.5814696485623003, "train_speed(iter/s)": 0.220917 }, { "epoch": 1.9895993836671804, "grad_norm": 1.6342151165008545, "learning_rate": 3.492541338598984e-05, "loss": 1.7928539276123048, "memory(GiB)": 136.87, "step": 5165, "token_acc": 0.5831344470962609, "train_speed(iter/s)": 0.221036 }, { "epoch": 1.9915254237288136, "grad_norm": 1.6661423444747925, "learning_rate": 3.4806385037071466e-05, "loss": 1.758956527709961, "memory(GiB)": 136.87, "step": 5170, "token_acc": 0.600776268367064, "train_speed(iter/s)": 0.221155 }, { "epoch": 1.9934514637904468, "grad_norm": 0.8810990452766418, "learning_rate": 3.468748153873955e-05, "loss": 1.7792442321777344, "memory(GiB)": 136.87, "step": 5175, "token_acc": 0.5803288145370638, "train_speed(iter/s)": 0.221274 }, { "epoch": 1.99537750385208, "grad_norm": 2.638519287109375, "learning_rate": 3.456870342704441e-05, "loss": 1.7636144638061524, "memory(GiB)": 136.87, "step": 5180, "token_acc": 0.59148570199957, "train_speed(iter/s)": 0.221393 }, { "epoch": 1.9973035439137135, "grad_norm": 1.0382333993911743, "learning_rate": 3.445005123747112e-05, "loss": 1.7433509826660156, "memory(GiB)": 136.87, "step": 5185, "token_acc": 0.5901734104046242, "train_speed(iter/s)": 0.221509 }, { "epoch": 1.9992295839753467, "grad_norm": 0.6550606489181519, "learning_rate": 3.4331525504937024e-05, "loss": 1.756174659729004, "memory(GiB)": 136.87, "step": 5190, "token_acc": 0.5928223305272485, "train_speed(iter/s)": 0.221629 }, { "epoch": 2.00115562403698, "grad_norm": 1.002230167388916, "learning_rate": 3.4213126763789365e-05, "loss": 1.7513559341430665, "memory(GiB)": 136.87, "step": 5195, "token_acc": 0.582216808769793, "train_speed(iter/s)": 0.221279 }, { "epoch": 2.0030816640986133, "grad_norm": 0.8959957361221313, "learning_rate": 3.4094855547802914e-05, "loss": 1.7084320068359375, "memory(GiB)": 136.87, "step": 5200, "token_acc": 0.6136532278011377, "train_speed(iter/s)": 0.221395 }, { "epoch": 2.0050077041602465, "grad_norm": 1.1862905025482178, "learning_rate": 3.397671239017747e-05, "loss": 1.7631097793579102, "memory(GiB)": 136.87, "step": 5205, "token_acc": 0.6013179571663921, "train_speed(iter/s)": 0.221285 }, { "epoch": 2.0069337442218798, "grad_norm": 1.0142595767974854, "learning_rate": 3.385869782353558e-05, "loss": 1.7849939346313477, "memory(GiB)": 136.87, "step": 5210, "token_acc": 0.5872841874486161, "train_speed(iter/s)": 0.221314 }, { "epoch": 2.008859784283513, "grad_norm": 1.3959475755691528, "learning_rate": 3.3740812379919966e-05, "loss": 1.7400804519653321, "memory(GiB)": 136.87, "step": 5215, "token_acc": 0.600238379022646, "train_speed(iter/s)": 0.221429 }, { "epoch": 2.010785824345146, "grad_norm": 0.7532147169113159, "learning_rate": 3.3623056590791304e-05, "loss": 1.7917526245117188, "memory(GiB)": 136.87, "step": 5220, "token_acc": 0.5999014535599901, "train_speed(iter/s)": 0.221458 }, { "epoch": 2.01271186440678, "grad_norm": 0.6776307225227356, "learning_rate": 3.350543098702578e-05, "loss": 1.7292966842651367, "memory(GiB)": 136.87, "step": 5225, "token_acc": 0.6041510377594399, "train_speed(iter/s)": 0.221574 }, { "epoch": 2.014637904468413, "grad_norm": 1.0134159326553345, "learning_rate": 3.338793609891254e-05, "loss": 1.7872634887695313, "memory(GiB)": 136.87, "step": 5230, "token_acc": 0.5996098512557912, "train_speed(iter/s)": 0.22158 }, { "epoch": 2.0165639445300463, "grad_norm": 0.7890477180480957, "learning_rate": 3.327057245615157e-05, "loss": 1.7631288528442384, "memory(GiB)": 136.87, "step": 5235, "token_acc": 0.6106666666666667, "train_speed(iter/s)": 0.221691 }, { "epoch": 2.0184899845916795, "grad_norm": 0.9302046895027161, "learning_rate": 3.3153340587851093e-05, "loss": 1.7238309860229493, "memory(GiB)": 136.87, "step": 5240, "token_acc": 0.5765494912118408, "train_speed(iter/s)": 0.221808 }, { "epoch": 2.0204160246533127, "grad_norm": 0.9802621006965637, "learning_rate": 3.303624102252521e-05, "loss": 1.7790721893310546, "memory(GiB)": 136.87, "step": 5245, "token_acc": 0.5934065934065934, "train_speed(iter/s)": 0.221778 }, { "epoch": 2.022342064714946, "grad_norm": 0.8716186285018921, "learning_rate": 3.291927428809168e-05, "loss": 1.7698394775390625, "memory(GiB)": 136.87, "step": 5250, "token_acc": 0.5776566757493188, "train_speed(iter/s)": 0.221893 }, { "epoch": 2.024268104776579, "grad_norm": 0.5871915221214294, "learning_rate": 3.28024409118693e-05, "loss": 1.7210758209228516, "memory(GiB)": 136.87, "step": 5255, "token_acc": 0.6186046511627907, "train_speed(iter/s)": 0.221883 }, { "epoch": 2.026194144838213, "grad_norm": 0.6136463284492493, "learning_rate": 3.268574142057575e-05, "loss": 1.7313335418701172, "memory(GiB)": 136.87, "step": 5260, "token_acc": 0.5952955367913149, "train_speed(iter/s)": 0.221898 }, { "epoch": 2.028120184899846, "grad_norm": 0.7708998918533325, "learning_rate": 3.256917634032509e-05, "loss": 1.6860092163085938, "memory(GiB)": 136.87, "step": 5265, "token_acc": 0.6016907011437096, "train_speed(iter/s)": 0.221937 }, { "epoch": 2.0300462249614792, "grad_norm": 0.7130012512207031, "learning_rate": 3.245274619662537e-05, "loss": 1.722970962524414, "memory(GiB)": 136.87, "step": 5270, "token_acc": 0.6030889924000981, "train_speed(iter/s)": 0.222028 }, { "epoch": 2.0319722650231125, "grad_norm": 0.7865249514579773, "learning_rate": 3.233645151437641e-05, "loss": 1.7922784805297851, "memory(GiB)": 136.87, "step": 5275, "token_acc": 0.591041162227603, "train_speed(iter/s)": 0.221958 }, { "epoch": 2.0338983050847457, "grad_norm": 0.7858544588088989, "learning_rate": 3.2220292817867176e-05, "loss": 1.7304275512695313, "memory(GiB)": 136.87, "step": 5280, "token_acc": 0.5880316518298714, "train_speed(iter/s)": 0.222075 }, { "epoch": 2.035824345146379, "grad_norm": 0.7417407035827637, "learning_rate": 3.210427063077374e-05, "loss": 1.8049266815185547, "memory(GiB)": 136.87, "step": 5285, "token_acc": 0.5957199348685741, "train_speed(iter/s)": 0.222086 }, { "epoch": 2.037750385208012, "grad_norm": 0.7264186143875122, "learning_rate": 3.198838547615666e-05, "loss": 1.7907276153564453, "memory(GiB)": 136.87, "step": 5290, "token_acc": 0.5973019517795637, "train_speed(iter/s)": 0.221955 }, { "epoch": 2.0396764252696458, "grad_norm": 0.7485206127166748, "learning_rate": 3.187263787645868e-05, "loss": 1.7790372848510743, "memory(GiB)": 136.87, "step": 5295, "token_acc": 0.5778218694885362, "train_speed(iter/s)": 0.222067 }, { "epoch": 2.041602465331279, "grad_norm": 0.9737213253974915, "learning_rate": 3.175702835350248e-05, "loss": 1.7832809448242188, "memory(GiB)": 136.87, "step": 5300, "token_acc": 0.5799609946367625, "train_speed(iter/s)": 0.222181 }, { "epoch": 2.043528505392912, "grad_norm": 3.211221218109131, "learning_rate": 3.1641557428488246e-05, "loss": 1.7909473419189452, "memory(GiB)": 136.87, "step": 5305, "token_acc": 0.6048717948717949, "train_speed(iter/s)": 0.222259 }, { "epoch": 2.0454545454545454, "grad_norm": 0.6070092916488647, "learning_rate": 3.152622562199133e-05, "loss": 1.7160694122314453, "memory(GiB)": 136.87, "step": 5310, "token_acc": 0.6003143006809848, "train_speed(iter/s)": 0.222373 }, { "epoch": 2.0473805855161786, "grad_norm": 0.7154187560081482, "learning_rate": 3.141103345395982e-05, "loss": 1.7437379837036133, "memory(GiB)": 136.87, "step": 5315, "token_acc": 0.5967302452316077, "train_speed(iter/s)": 0.222372 }, { "epoch": 2.049306625577812, "grad_norm": 1.1265685558319092, "learning_rate": 3.1295981443712336e-05, "loss": 1.724435806274414, "memory(GiB)": 136.87, "step": 5320, "token_acc": 0.5940999726850588, "train_speed(iter/s)": 0.222375 }, { "epoch": 2.0512326656394455, "grad_norm": 0.6729488968849182, "learning_rate": 3.1181070109935664e-05, "loss": 1.7445075988769532, "memory(GiB)": 136.87, "step": 5325, "token_acc": 0.6106037544393709, "train_speed(iter/s)": 0.222491 }, { "epoch": 2.0531587057010787, "grad_norm": 1.0702611207962036, "learning_rate": 3.106629997068228e-05, "loss": 1.7624216079711914, "memory(GiB)": 136.87, "step": 5330, "token_acc": 0.5906773488710853, "train_speed(iter/s)": 0.222477 }, { "epoch": 2.055084745762712, "grad_norm": 0.7213516235351562, "learning_rate": 3.095167154336824e-05, "loss": 1.7853103637695313, "memory(GiB)": 136.87, "step": 5335, "token_acc": 0.606768558951965, "train_speed(iter/s)": 0.222488 }, { "epoch": 2.057010785824345, "grad_norm": 1.4011636972427368, "learning_rate": 3.083718534477059e-05, "loss": 1.812076950073242, "memory(GiB)": 136.87, "step": 5340, "token_acc": 0.5760108425570364, "train_speed(iter/s)": 0.222451 }, { "epoch": 2.0589368258859784, "grad_norm": 1.0200453996658325, "learning_rate": 3.072284189102529e-05, "loss": 1.7605985641479491, "memory(GiB)": 136.87, "step": 5345, "token_acc": 0.6078136739293765, "train_speed(iter/s)": 0.222566 }, { "epoch": 2.0608628659476116, "grad_norm": 0.6703549027442932, "learning_rate": 3.060864169762466e-05, "loss": 1.7926494598388671, "memory(GiB)": 136.87, "step": 5350, "token_acc": 0.5757756563245824, "train_speed(iter/s)": 0.222553 }, { "epoch": 2.062788906009245, "grad_norm": 0.8992184400558472, "learning_rate": 3.0494585279415248e-05, "loss": 1.8008771896362306, "memory(GiB)": 136.87, "step": 5355, "token_acc": 0.5827029752899647, "train_speed(iter/s)": 0.222652 }, { "epoch": 2.0647149460708785, "grad_norm": 2.7358310222625732, "learning_rate": 3.0380673150595402e-05, "loss": 1.7705488204956055, "memory(GiB)": 136.87, "step": 5360, "token_acc": 0.5932246561385635, "train_speed(iter/s)": 0.22273 }, { "epoch": 2.0666409861325117, "grad_norm": 0.8945984244346619, "learning_rate": 3.026690582471294e-05, "loss": 1.7663822174072266, "memory(GiB)": 136.87, "step": 5365, "token_acc": 0.5744282744282744, "train_speed(iter/s)": 0.222693 }, { "epoch": 2.068567026194145, "grad_norm": 0.8307556509971619, "learning_rate": 3.015328381466287e-05, "loss": 1.752301025390625, "memory(GiB)": 136.87, "step": 5370, "token_acc": 0.5937697326878552, "train_speed(iter/s)": 0.222792 }, { "epoch": 2.070493066255778, "grad_norm": 1.1805006265640259, "learning_rate": 3.003980763268513e-05, "loss": 1.752029037475586, "memory(GiB)": 136.87, "step": 5375, "token_acc": 0.5853242320819113, "train_speed(iter/s)": 0.222904 }, { "epoch": 2.0724191063174113, "grad_norm": 1.1215310096740723, "learning_rate": 2.9926477790362143e-05, "loss": 1.7429954528808593, "memory(GiB)": 136.87, "step": 5380, "token_acc": 0.5878453038674033, "train_speed(iter/s)": 0.222945 }, { "epoch": 2.0743451463790445, "grad_norm": 1.3918564319610596, "learning_rate": 2.9813294798616685e-05, "loss": 1.7547735214233398, "memory(GiB)": 136.87, "step": 5385, "token_acc": 0.6170278637770897, "train_speed(iter/s)": 0.223056 }, { "epoch": 2.0762711864406778, "grad_norm": 1.5303163528442383, "learning_rate": 2.9700259167709395e-05, "loss": 1.7574665069580078, "memory(GiB)": 136.87, "step": 5390, "token_acc": 0.6038481813389562, "train_speed(iter/s)": 0.223089 }, { "epoch": 2.0781972265023114, "grad_norm": 1.5610618591308594, "learning_rate": 2.9587371407236627e-05, "loss": 1.7871456146240234, "memory(GiB)": 136.87, "step": 5395, "token_acc": 0.5936451549240181, "train_speed(iter/s)": 0.223128 }, { "epoch": 2.0801232665639446, "grad_norm": 0.7098233699798584, "learning_rate": 2.9474632026128115e-05, "loss": 1.7829280853271485, "memory(GiB)": 136.87, "step": 5400, "token_acc": 0.5740441572428648, "train_speed(iter/s)": 0.22324 }, { "epoch": 2.082049306625578, "grad_norm": 0.7072461247444153, "learning_rate": 2.9362041532644566e-05, "loss": 1.765349769592285, "memory(GiB)": 136.87, "step": 5405, "token_acc": 0.6166306695464363, "train_speed(iter/s)": 0.223149 }, { "epoch": 2.083975346687211, "grad_norm": 1.2645729780197144, "learning_rate": 2.9249600434375557e-05, "loss": 1.7672847747802733, "memory(GiB)": 136.87, "step": 5410, "token_acc": 0.5771569745343975, "train_speed(iter/s)": 0.223261 }, { "epoch": 2.0859013867488443, "grad_norm": 0.6643367409706116, "learning_rate": 2.9137309238237098e-05, "loss": 1.7804122924804688, "memory(GiB)": 136.87, "step": 5415, "token_acc": 0.5878535002318034, "train_speed(iter/s)": 0.223192 }, { "epoch": 2.0878274268104775, "grad_norm": 1.6858524084091187, "learning_rate": 2.9025168450469374e-05, "loss": 1.791745948791504, "memory(GiB)": 136.87, "step": 5420, "token_acc": 0.5888480392156863, "train_speed(iter/s)": 0.2233 }, { "epoch": 2.0897534668721107, "grad_norm": 0.8708013892173767, "learning_rate": 2.8913178576634565e-05, "loss": 1.7970867156982422, "memory(GiB)": 136.87, "step": 5425, "token_acc": 0.5805369127516778, "train_speed(iter/s)": 0.223348 }, { "epoch": 2.0916795069337444, "grad_norm": 2.335855484008789, "learning_rate": 2.880134012161441e-05, "loss": 1.7321935653686524, "memory(GiB)": 136.87, "step": 5430, "token_acc": 0.5963735717834079, "train_speed(iter/s)": 0.223461 }, { "epoch": 2.0936055469953776, "grad_norm": 1.251335859298706, "learning_rate": 2.8689653589608053e-05, "loss": 1.7464317321777343, "memory(GiB)": 136.87, "step": 5435, "token_acc": 0.6101456082667919, "train_speed(iter/s)": 0.223572 }, { "epoch": 2.095531587057011, "grad_norm": 2.3458919525146484, "learning_rate": 2.8578119484129743e-05, "loss": 1.7120725631713867, "memory(GiB)": 136.87, "step": 5440, "token_acc": 0.6019539078156313, "train_speed(iter/s)": 0.223608 }, { "epoch": 2.097457627118644, "grad_norm": 0.7641324996948242, "learning_rate": 2.8466738308006486e-05, "loss": 1.747948455810547, "memory(GiB)": 136.87, "step": 5445, "token_acc": 0.5750273822562979, "train_speed(iter/s)": 0.223562 }, { "epoch": 2.0993836671802772, "grad_norm": 4.340232849121094, "learning_rate": 2.8355510563375908e-05, "loss": 1.742392349243164, "memory(GiB)": 136.87, "step": 5450, "token_acc": 0.5916827852998066, "train_speed(iter/s)": 0.22357 }, { "epoch": 2.1013097072419105, "grad_norm": 1.0343068838119507, "learning_rate": 2.8244436751683873e-05, "loss": 1.7836574554443358, "memory(GiB)": 136.87, "step": 5455, "token_acc": 0.5978904039104708, "train_speed(iter/s)": 0.223582 }, { "epoch": 2.103235747303544, "grad_norm": 0.9237492084503174, "learning_rate": 2.8133517373682263e-05, "loss": 1.7888507843017578, "memory(GiB)": 136.87, "step": 5460, "token_acc": 0.5938592111832252, "train_speed(iter/s)": 0.223695 }, { "epoch": 2.1051617873651773, "grad_norm": 1.36170494556427, "learning_rate": 2.8022752929426804e-05, "loss": 1.6904106140136719, "memory(GiB)": 136.87, "step": 5465, "token_acc": 0.5820635611667392, "train_speed(iter/s)": 0.223778 }, { "epoch": 2.1070878274268106, "grad_norm": 0.816930890083313, "learning_rate": 2.7912143918274646e-05, "loss": 1.7456085205078125, "memory(GiB)": 136.87, "step": 5470, "token_acc": 0.6003277920861625, "train_speed(iter/s)": 0.223616 }, { "epoch": 2.1090138674884438, "grad_norm": 1.202661156654358, "learning_rate": 2.780169083888226e-05, "loss": 1.7445419311523438, "memory(GiB)": 136.87, "step": 5475, "token_acc": 0.5898176967541129, "train_speed(iter/s)": 0.223726 }, { "epoch": 2.110939907550077, "grad_norm": 1.0403882265090942, "learning_rate": 2.769139418920314e-05, "loss": 1.7659944534301757, "memory(GiB)": 136.87, "step": 5480, "token_acc": 0.5869369369369369, "train_speed(iter/s)": 0.223676 }, { "epoch": 2.11286594761171, "grad_norm": 0.8089464902877808, "learning_rate": 2.7581254466485497e-05, "loss": 1.7627185821533202, "memory(GiB)": 136.87, "step": 5485, "token_acc": 0.5913550782285866, "train_speed(iter/s)": 0.223788 }, { "epoch": 2.1147919876733434, "grad_norm": 0.9885238409042358, "learning_rate": 2.747127216727014e-05, "loss": 1.7506807327270508, "memory(GiB)": 136.87, "step": 5490, "token_acc": 0.5654557916381083, "train_speed(iter/s)": 0.223726 }, { "epoch": 2.116718027734977, "grad_norm": 0.871893048286438, "learning_rate": 2.736144778738809e-05, "loss": 1.7617019653320312, "memory(GiB)": 136.87, "step": 5495, "token_acc": 0.5988602576808721, "train_speed(iter/s)": 0.223835 }, { "epoch": 2.1186440677966103, "grad_norm": 0.7188717126846313, "learning_rate": 2.7251781821958512e-05, "loss": 1.7487606048583983, "memory(GiB)": 136.87, "step": 5500, "token_acc": 0.5977782920620227, "train_speed(iter/s)": 0.223948 }, { "epoch": 2.1205701078582435, "grad_norm": 0.8923308849334717, "learning_rate": 2.7142274765386318e-05, "loss": 1.7874326705932617, "memory(GiB)": 136.87, "step": 5505, "token_acc": 0.57819782496116, "train_speed(iter/s)": 0.223963 }, { "epoch": 2.1224961479198767, "grad_norm": 0.6797767877578735, "learning_rate": 2.7032927111360032e-05, "loss": 1.7409374237060546, "memory(GiB)": 136.87, "step": 5510, "token_acc": 0.6103928393833914, "train_speed(iter/s)": 0.224071 }, { "epoch": 2.12442218798151, "grad_norm": 0.9791479110717773, "learning_rate": 2.6923739352849573e-05, "loss": 1.7571197509765626, "memory(GiB)": 136.87, "step": 5515, "token_acc": 0.6049951969260327, "train_speed(iter/s)": 0.224114 }, { "epoch": 2.126348228043143, "grad_norm": 0.9937036037445068, "learning_rate": 2.6814711982103995e-05, "loss": 1.7820331573486328, "memory(GiB)": 136.87, "step": 5520, "token_acc": 0.5969299331517702, "train_speed(iter/s)": 0.224225 }, { "epoch": 2.1282742681047764, "grad_norm": 0.8245801329612732, "learning_rate": 2.670584549064929e-05, "loss": 1.696131134033203, "memory(GiB)": 136.87, "step": 5525, "token_acc": 0.5842323651452282, "train_speed(iter/s)": 0.224336 }, { "epoch": 2.13020030816641, "grad_norm": 0.7906369566917419, "learning_rate": 2.659714036928614e-05, "loss": 1.6972728729248048, "memory(GiB)": 136.87, "step": 5530, "token_acc": 0.6151954757806737, "train_speed(iter/s)": 0.224182 }, { "epoch": 2.1321263482280433, "grad_norm": 0.9253937602043152, "learning_rate": 2.6488597108087707e-05, "loss": 1.7359500885009767, "memory(GiB)": 136.87, "step": 5535, "token_acc": 0.595333667837431, "train_speed(iter/s)": 0.224268 }, { "epoch": 2.1340523882896765, "grad_norm": 0.828896701335907, "learning_rate": 2.6380216196397507e-05, "loss": 1.7639318466186524, "memory(GiB)": 136.87, "step": 5540, "token_acc": 0.6035739478015518, "train_speed(iter/s)": 0.224233 }, { "epoch": 2.1359784283513097, "grad_norm": 0.6512668132781982, "learning_rate": 2.627199812282705e-05, "loss": 1.7584911346435548, "memory(GiB)": 136.87, "step": 5545, "token_acc": 0.5846567310041534, "train_speed(iter/s)": 0.224339 }, { "epoch": 2.137904468412943, "grad_norm": 0.7185530066490173, "learning_rate": 2.616394337525383e-05, "loss": 1.7568840026855468, "memory(GiB)": 136.87, "step": 5550, "token_acc": 0.5904852976332775, "train_speed(iter/s)": 0.224218 }, { "epoch": 2.139830508474576, "grad_norm": 1.4348018169403076, "learning_rate": 2.6056052440818912e-05, "loss": 1.789164924621582, "memory(GiB)": 136.87, "step": 5555, "token_acc": 0.5907818220977816, "train_speed(iter/s)": 0.224329 }, { "epoch": 2.1417565485362093, "grad_norm": 1.0587968826293945, "learning_rate": 2.5948325805924933e-05, "loss": 1.7193296432495118, "memory(GiB)": 136.87, "step": 5560, "token_acc": 0.5816825315153075, "train_speed(iter/s)": 0.224441 }, { "epoch": 2.143682588597843, "grad_norm": 1.2495542764663696, "learning_rate": 2.5840763956233797e-05, "loss": 1.7446285247802735, "memory(GiB)": 136.87, "step": 5565, "token_acc": 0.5625936229402954, "train_speed(iter/s)": 0.224302 }, { "epoch": 2.145608628659476, "grad_norm": 0.679328203201294, "learning_rate": 2.5733367376664472e-05, "loss": 1.7491580963134765, "memory(GiB)": 136.87, "step": 5570, "token_acc": 0.5935931149892422, "train_speed(iter/s)": 0.224412 }, { "epoch": 2.1475346687211094, "grad_norm": 0.9046332836151123, "learning_rate": 2.5626136551390914e-05, "loss": 1.7191360473632813, "memory(GiB)": 136.87, "step": 5575, "token_acc": 0.5783503172466833, "train_speed(iter/s)": 0.224369 }, { "epoch": 2.1494607087827426, "grad_norm": 0.9884324073791504, "learning_rate": 2.5519071963839734e-05, "loss": 1.7653175354003907, "memory(GiB)": 136.87, "step": 5580, "token_acc": 0.5966894377299001, "train_speed(iter/s)": 0.224476 }, { "epoch": 2.151386748844376, "grad_norm": 0.8270488381385803, "learning_rate": 2.5412174096688126e-05, "loss": 1.7322196960449219, "memory(GiB)": 136.87, "step": 5585, "token_acc": 0.5961224013081056, "train_speed(iter/s)": 0.224587 }, { "epoch": 2.153312788906009, "grad_norm": 1.0333666801452637, "learning_rate": 2.5305443431861704e-05, "loss": 1.764253807067871, "memory(GiB)": 136.87, "step": 5590, "token_acc": 0.5771205586362703, "train_speed(iter/s)": 0.224548 }, { "epoch": 2.1552388289676427, "grad_norm": 1.0959030389785767, "learning_rate": 2.519888045053221e-05, "loss": 1.757779312133789, "memory(GiB)": 136.87, "step": 5595, "token_acc": 0.6020434896515588, "train_speed(iter/s)": 0.224654 }, { "epoch": 2.157164869029276, "grad_norm": 0.7591630220413208, "learning_rate": 2.5092485633115488e-05, "loss": 1.686333465576172, "memory(GiB)": 136.87, "step": 5600, "token_acc": 0.6006639791320845, "train_speed(iter/s)": 0.22453 }, { "epoch": 2.159090909090909, "grad_norm": 2.6796927452087402, "learning_rate": 2.498625945926924e-05, "loss": 1.6895587921142579, "memory(GiB)": 136.87, "step": 5605, "token_acc": 0.6046040981533013, "train_speed(iter/s)": 0.224641 }, { "epoch": 2.1610169491525424, "grad_norm": 0.7851228713989258, "learning_rate": 2.488020240789082e-05, "loss": 1.6927921295166015, "memory(GiB)": 136.87, "step": 5610, "token_acc": 0.6114089641861462, "train_speed(iter/s)": 0.224616 }, { "epoch": 2.1629429892141756, "grad_norm": 1.051344394683838, "learning_rate": 2.4774314957115232e-05, "loss": 1.7543220520019531, "memory(GiB)": 136.87, "step": 5615, "token_acc": 0.595572117492328, "train_speed(iter/s)": 0.224725 }, { "epoch": 2.164869029275809, "grad_norm": 1.2848819494247437, "learning_rate": 2.466859758431275e-05, "loss": 1.7809551239013672, "memory(GiB)": 136.87, "step": 5620, "token_acc": 0.5739819004524886, "train_speed(iter/s)": 0.224793 }, { "epoch": 2.166795069337442, "grad_norm": 0.8399608731269836, "learning_rate": 2.456305076608701e-05, "loss": 1.7612316131591796, "memory(GiB)": 136.87, "step": 5625, "token_acc": 0.5628223159868729, "train_speed(iter/s)": 0.224754 }, { "epoch": 2.1687211093990757, "grad_norm": 0.9708801507949829, "learning_rate": 2.4457674978272656e-05, "loss": 1.7776823043823242, "memory(GiB)": 136.87, "step": 5630, "token_acc": 0.5833490655087785, "train_speed(iter/s)": 0.224784 }, { "epoch": 2.170647149460709, "grad_norm": 1.3746745586395264, "learning_rate": 2.4352470695933276e-05, "loss": 1.711482620239258, "memory(GiB)": 136.87, "step": 5635, "token_acc": 0.5966542750929368, "train_speed(iter/s)": 0.2247 }, { "epoch": 2.172573189522342, "grad_norm": 1.3227323293685913, "learning_rate": 2.4247438393359327e-05, "loss": 1.7514347076416015, "memory(GiB)": 136.87, "step": 5640, "token_acc": 0.6215532506956741, "train_speed(iter/s)": 0.224808 }, { "epoch": 2.1744992295839753, "grad_norm": 1.1723637580871582, "learning_rate": 2.414257854406591e-05, "loss": 1.7996936798095704, "memory(GiB)": 136.87, "step": 5645, "token_acc": 0.589143659335517, "train_speed(iter/s)": 0.224915 }, { "epoch": 2.1764252696456086, "grad_norm": 1.1936994791030884, "learning_rate": 2.4037891620790614e-05, "loss": 1.8253034591674804, "memory(GiB)": 136.87, "step": 5650, "token_acc": 0.5688430698739977, "train_speed(iter/s)": 0.224691 }, { "epoch": 2.178351309707242, "grad_norm": 0.8679848313331604, "learning_rate": 2.3933378095491496e-05, "loss": 1.747736358642578, "memory(GiB)": 136.87, "step": 5655, "token_acc": 0.6099570200573066, "train_speed(iter/s)": 0.224798 }, { "epoch": 2.180277349768875, "grad_norm": 0.7936636805534363, "learning_rate": 2.3829038439344815e-05, "loss": 1.7538631439208985, "memory(GiB)": 136.87, "step": 5660, "token_acc": 0.6114092064388591, "train_speed(iter/s)": 0.224568 }, { "epoch": 2.1822033898305087, "grad_norm": 1.0102686882019043, "learning_rate": 2.3724873122743053e-05, "loss": 1.757767105102539, "memory(GiB)": 136.87, "step": 5665, "token_acc": 0.6019279841224837, "train_speed(iter/s)": 0.224673 }, { "epoch": 2.184129429892142, "grad_norm": 1.174321174621582, "learning_rate": 2.3620882615292648e-05, "loss": 1.7683483123779298, "memory(GiB)": 136.87, "step": 5670, "token_acc": 0.592433361994841, "train_speed(iter/s)": 0.224683 }, { "epoch": 2.186055469953775, "grad_norm": 1.0656726360321045, "learning_rate": 2.3517067385812017e-05, "loss": 1.7764266967773437, "memory(GiB)": 136.87, "step": 5675, "token_acc": 0.5856156757960366, "train_speed(iter/s)": 0.22479 }, { "epoch": 2.1879815100154083, "grad_norm": 0.7482308149337769, "learning_rate": 2.3413427902329337e-05, "loss": 1.7619640350341796, "memory(GiB)": 136.87, "step": 5680, "token_acc": 0.5906998158379374, "train_speed(iter/s)": 0.224894 }, { "epoch": 2.1899075500770415, "grad_norm": 0.9743887782096863, "learning_rate": 2.3309964632080448e-05, "loss": 1.7943431854248046, "memory(GiB)": 136.87, "step": 5685, "token_acc": 0.5755673587638822, "train_speed(iter/s)": 0.224738 }, { "epoch": 2.1918335901386747, "grad_norm": 0.9789854288101196, "learning_rate": 2.320667804150682e-05, "loss": 1.74476318359375, "memory(GiB)": 136.87, "step": 5690, "token_acc": 0.6029879990203282, "train_speed(iter/s)": 0.224844 }, { "epoch": 2.193759630200308, "grad_norm": 0.6164162755012512, "learning_rate": 2.3103568596253406e-05, "loss": 1.7530014038085937, "memory(GiB)": 136.87, "step": 5695, "token_acc": 0.5818520049607275, "train_speed(iter/s)": 0.224664 }, { "epoch": 2.1956856702619416, "grad_norm": 0.8012659549713135, "learning_rate": 2.3000636761166483e-05, "loss": 1.7739967346191405, "memory(GiB)": 136.87, "step": 5700, "token_acc": 0.5790038643194504, "train_speed(iter/s)": 0.224766 }, { "epoch": 2.197611710323575, "grad_norm": 1.168314814567566, "learning_rate": 2.289788300029167e-05, "loss": 1.763479995727539, "memory(GiB)": 136.87, "step": 5705, "token_acc": 0.5948987246811703, "train_speed(iter/s)": 0.224873 }, { "epoch": 2.199537750385208, "grad_norm": 0.5416064262390137, "learning_rate": 2.2795307776871722e-05, "loss": 1.7594837188720702, "memory(GiB)": 136.87, "step": 5710, "token_acc": 0.579345648787002, "train_speed(iter/s)": 0.224755 }, { "epoch": 2.2014637904468413, "grad_norm": 0.7491913437843323, "learning_rate": 2.2692911553344562e-05, "loss": 1.7440570831298827, "memory(GiB)": 136.87, "step": 5715, "token_acc": 0.614974686917133, "train_speed(iter/s)": 0.224861 }, { "epoch": 2.2033898305084745, "grad_norm": 0.8597451448440552, "learning_rate": 2.2590694791341077e-05, "loss": 1.7954248428344726, "memory(GiB)": 136.87, "step": 5720, "token_acc": 0.5998505976095617, "train_speed(iter/s)": 0.224783 }, { "epoch": 2.2053158705701077, "grad_norm": 0.8029189109802246, "learning_rate": 2.2488657951683088e-05, "loss": 1.7311023712158202, "memory(GiB)": 136.87, "step": 5725, "token_acc": 0.6099334995843724, "train_speed(iter/s)": 0.224889 }, { "epoch": 2.2072419106317414, "grad_norm": 1.3154871463775635, "learning_rate": 2.238680149438132e-05, "loss": 1.7625280380249024, "memory(GiB)": 136.87, "step": 5730, "token_acc": 0.5704955820207452, "train_speed(iter/s)": 0.224855 }, { "epoch": 2.2091679506933746, "grad_norm": 1.3025659322738647, "learning_rate": 2.2285125878633252e-05, "loss": 1.744378662109375, "memory(GiB)": 136.87, "step": 5735, "token_acc": 0.5831643002028397, "train_speed(iter/s)": 0.224958 }, { "epoch": 2.211093990755008, "grad_norm": 0.5923758149147034, "learning_rate": 2.2183631562821125e-05, "loss": 1.741799545288086, "memory(GiB)": 136.87, "step": 5740, "token_acc": 0.5941550190597205, "train_speed(iter/s)": 0.225066 }, { "epoch": 2.213020030816641, "grad_norm": 0.7142196893692017, "learning_rate": 2.2082319004509765e-05, "loss": 1.6759931564331054, "memory(GiB)": 136.87, "step": 5745, "token_acc": 0.6022566995768688, "train_speed(iter/s)": 0.224828 }, { "epoch": 2.214946070878274, "grad_norm": 0.5992212891578674, "learning_rate": 2.1981188660444582e-05, "loss": 1.7082429885864259, "memory(GiB)": 136.87, "step": 5750, "token_acc": 0.610844892812106, "train_speed(iter/s)": 0.224932 }, { "epoch": 2.2168721109399074, "grad_norm": 0.7615183591842651, "learning_rate": 2.1880240986549588e-05, "loss": 1.786642837524414, "memory(GiB)": 136.87, "step": 5755, "token_acc": 0.5765016233766234, "train_speed(iter/s)": 0.224777 }, { "epoch": 2.2187981510015407, "grad_norm": 1.2968544960021973, "learning_rate": 2.1779476437925176e-05, "loss": 1.735111618041992, "memory(GiB)": 136.87, "step": 5760, "token_acc": 0.5931955750365269, "train_speed(iter/s)": 0.22488 }, { "epoch": 2.2207241910631743, "grad_norm": 0.6040327548980713, "learning_rate": 2.1678895468846258e-05, "loss": 1.8075164794921874, "memory(GiB)": 136.87, "step": 5765, "token_acc": 0.5860338699560945, "train_speed(iter/s)": 0.224981 }, { "epoch": 2.2226502311248075, "grad_norm": 1.311569333076477, "learning_rate": 2.1578498532760005e-05, "loss": 1.719764518737793, "memory(GiB)": 136.87, "step": 5770, "token_acc": 0.6135014836795252, "train_speed(iter/s)": 0.224999 }, { "epoch": 2.2245762711864407, "grad_norm": 1.056206226348877, "learning_rate": 2.1478286082284005e-05, "loss": 1.7587699890136719, "memory(GiB)": 136.87, "step": 5775, "token_acc": 0.5957149510945505, "train_speed(iter/s)": 0.225106 }, { "epoch": 2.226502311248074, "grad_norm": 1.0323842763900757, "learning_rate": 2.1378258569204118e-05, "loss": 1.737189483642578, "memory(GiB)": 136.87, "step": 5780, "token_acc": 0.5930877078578415, "train_speed(iter/s)": 0.225106 }, { "epoch": 2.228428351309707, "grad_norm": 0.7793471813201904, "learning_rate": 2.1278416444472397e-05, "loss": 1.7449146270751954, "memory(GiB)": 136.87, "step": 5785, "token_acc": 0.570738255033557, "train_speed(iter/s)": 0.225212 }, { "epoch": 2.2303543913713404, "grad_norm": 0.9886042475700378, "learning_rate": 2.1178760158205204e-05, "loss": 1.7651954650878907, "memory(GiB)": 136.87, "step": 5790, "token_acc": 0.5648300117233295, "train_speed(iter/s)": 0.225128 }, { "epoch": 2.2322804314329736, "grad_norm": 0.7703076004981995, "learning_rate": 2.1079290159681004e-05, "loss": 1.769308090209961, "memory(GiB)": 136.87, "step": 5795, "token_acc": 0.571583514099783, "train_speed(iter/s)": 0.225234 }, { "epoch": 2.2342064714946073, "grad_norm": 0.6322337985038757, "learning_rate": 2.098000689733845e-05, "loss": 1.709291648864746, "memory(GiB)": 136.87, "step": 5800, "token_acc": 0.576911544227886, "train_speed(iter/s)": 0.225337 }, { "epoch": 2.2361325115562405, "grad_norm": 0.6153098940849304, "learning_rate": 2.088091081877438e-05, "loss": 1.7767284393310547, "memory(GiB)": 136.87, "step": 5805, "token_acc": 0.5846661589235846, "train_speed(iter/s)": 0.225185 }, { "epoch": 2.2380585516178737, "grad_norm": 1.0357624292373657, "learning_rate": 2.078200237074168e-05, "loss": 1.7777097702026368, "memory(GiB)": 136.87, "step": 5810, "token_acc": 0.576578453844551, "train_speed(iter/s)": 0.225288 }, { "epoch": 2.239984591679507, "grad_norm": 1.0849571228027344, "learning_rate": 2.068328199914741e-05, "loss": 1.7909885406494142, "memory(GiB)": 136.87, "step": 5815, "token_acc": 0.5976318622174381, "train_speed(iter/s)": 0.225109 }, { "epoch": 2.24191063174114, "grad_norm": 0.8185885548591614, "learning_rate": 2.0584750149050724e-05, "loss": 1.7212383270263671, "memory(GiB)": 136.87, "step": 5820, "token_acc": 0.5954932673811487, "train_speed(iter/s)": 0.225213 }, { "epoch": 2.2438366718027734, "grad_norm": 0.9814592003822327, "learning_rate": 2.0486407264660798e-05, "loss": 1.8037248611450196, "memory(GiB)": 136.87, "step": 5825, "token_acc": 0.5645435244161359, "train_speed(iter/s)": 0.225317 }, { "epoch": 2.2457627118644066, "grad_norm": 0.7732944488525391, "learning_rate": 2.0388253789334995e-05, "loss": 1.7740798950195313, "memory(GiB)": 136.87, "step": 5830, "token_acc": 0.6174626145682586, "train_speed(iter/s)": 0.225245 }, { "epoch": 2.2476887519260402, "grad_norm": 2.3589956760406494, "learning_rate": 2.0290290165576686e-05, "loss": 1.7364799499511718, "memory(GiB)": 136.87, "step": 5835, "token_acc": 0.5989328590484659, "train_speed(iter/s)": 0.225349 }, { "epoch": 2.2496147919876734, "grad_norm": 0.8114894032478333, "learning_rate": 2.0192516835033405e-05, "loss": 1.7586339950561523, "memory(GiB)": 136.87, "step": 5840, "token_acc": 0.5891400605919366, "train_speed(iter/s)": 0.225158 }, { "epoch": 2.2515408320493067, "grad_norm": 1.414918303489685, "learning_rate": 2.009493423849474e-05, "loss": 1.6632991790771485, "memory(GiB)": 136.87, "step": 5845, "token_acc": 0.6072786529060293, "train_speed(iter/s)": 0.225264 }, { "epoch": 2.25346687211094, "grad_norm": 1.3454980850219727, "learning_rate": 1.9997542815890403e-05, "loss": 1.7303869247436523, "memory(GiB)": 136.87, "step": 5850, "token_acc": 0.5920074349442379, "train_speed(iter/s)": 0.225296 }, { "epoch": 2.255392912172573, "grad_norm": 0.6571111679077148, "learning_rate": 1.990034300628826e-05, "loss": 1.7632432937622071, "memory(GiB)": 136.87, "step": 5855, "token_acc": 0.6028387787895019, "train_speed(iter/s)": 0.225399 }, { "epoch": 2.2573189522342063, "grad_norm": 1.9203803539276123, "learning_rate": 1.9803335247892337e-05, "loss": 1.7730270385742188, "memory(GiB)": 136.87, "step": 5860, "token_acc": 0.5724017127286882, "train_speed(iter/s)": 0.225502 }, { "epoch": 2.25924499229584, "grad_norm": 1.38410484790802, "learning_rate": 1.970651997804085e-05, "loss": 1.7617721557617188, "memory(GiB)": 136.87, "step": 5865, "token_acc": 0.599640933572711, "train_speed(iter/s)": 0.225419 }, { "epoch": 2.261171032357473, "grad_norm": 1.0010985136032104, "learning_rate": 1.9609897633204157e-05, "loss": 1.752220916748047, "memory(GiB)": 136.87, "step": 5870, "token_acc": 0.5799797775530839, "train_speed(iter/s)": 0.225523 }, { "epoch": 2.2630970724191064, "grad_norm": 0.9653367400169373, "learning_rate": 1.9513468648982903e-05, "loss": 1.8167720794677735, "memory(GiB)": 136.87, "step": 5875, "token_acc": 0.5817055740828966, "train_speed(iter/s)": 0.225402 }, { "epoch": 2.2650231124807396, "grad_norm": 0.9891018867492676, "learning_rate": 1.9417233460106035e-05, "loss": 1.7467689514160156, "memory(GiB)": 136.87, "step": 5880, "token_acc": 0.5769230769230769, "train_speed(iter/s)": 0.225503 }, { "epoch": 2.266949152542373, "grad_norm": 0.7973118424415588, "learning_rate": 1.932119250042874e-05, "loss": 1.777346420288086, "memory(GiB)": 136.87, "step": 5885, "token_acc": 0.5731962687987816, "train_speed(iter/s)": 0.225605 }, { "epoch": 2.268875192604006, "grad_norm": 1.1933033466339111, "learning_rate": 1.9225346202930662e-05, "loss": 1.7208393096923829, "memory(GiB)": 136.87, "step": 5890, "token_acc": 0.5904145077720208, "train_speed(iter/s)": 0.225464 }, { "epoch": 2.2708012326656393, "grad_norm": 0.6677148938179016, "learning_rate": 1.912969499971376e-05, "loss": 1.7478357315063477, "memory(GiB)": 136.87, "step": 5895, "token_acc": 0.576702591148819, "train_speed(iter/s)": 0.225567 }, { "epoch": 2.2727272727272725, "grad_norm": 0.9810054302215576, "learning_rate": 1.903423932200051e-05, "loss": 1.753171157836914, "memory(GiB)": 136.87, "step": 5900, "token_acc": 0.5840818884478797, "train_speed(iter/s)": 0.225514 }, { "epoch": 2.274653312788906, "grad_norm": 0.8484246730804443, "learning_rate": 1.8938979600131912e-05, "loss": 1.7563274383544922, "memory(GiB)": 136.87, "step": 5905, "token_acc": 0.5948657421068162, "train_speed(iter/s)": 0.225619 }, { "epoch": 2.2765793528505394, "grad_norm": 1.4688133001327515, "learning_rate": 1.8843916263565484e-05, "loss": 1.7640121459960938, "memory(GiB)": 136.87, "step": 5910, "token_acc": 0.6093247588424437, "train_speed(iter/s)": 0.225517 }, { "epoch": 2.2785053929121726, "grad_norm": 0.880670964717865, "learning_rate": 1.8749049740873458e-05, "loss": 1.734806442260742, "memory(GiB)": 136.87, "step": 5915, "token_acc": 0.5800039753528126, "train_speed(iter/s)": 0.225618 }, { "epoch": 2.280431432973806, "grad_norm": 1.296202540397644, "learning_rate": 1.865438045974071e-05, "loss": 1.7341510772705078, "memory(GiB)": 136.87, "step": 5920, "token_acc": 0.5931729155008394, "train_speed(iter/s)": 0.225722 }, { "epoch": 2.282357473035439, "grad_norm": 1.7748517990112305, "learning_rate": 1.8559908846962905e-05, "loss": 1.7110935211181642, "memory(GiB)": 136.87, "step": 5925, "token_acc": 0.6011699016219091, "train_speed(iter/s)": 0.225507 }, { "epoch": 2.2842835130970722, "grad_norm": 1.1858643293380737, "learning_rate": 1.846563532844462e-05, "loss": 1.682388687133789, "memory(GiB)": 136.87, "step": 5930, "token_acc": 0.610774818401937, "train_speed(iter/s)": 0.225608 }, { "epoch": 2.286209553158706, "grad_norm": 0.6789790987968445, "learning_rate": 1.8371560329197298e-05, "loss": 1.7419265747070312, "memory(GiB)": 136.87, "step": 5935, "token_acc": 0.584741550695825, "train_speed(iter/s)": 0.225561 }, { "epoch": 2.288135593220339, "grad_norm": 1.6734957695007324, "learning_rate": 1.8277684273337433e-05, "loss": 1.746148681640625, "memory(GiB)": 136.87, "step": 5940, "token_acc": 0.5894994559303591, "train_speed(iter/s)": 0.225662 }, { "epoch": 2.2900616332819723, "grad_norm": 2.039332628250122, "learning_rate": 1.818400758408465e-05, "loss": 1.760708999633789, "memory(GiB)": 136.87, "step": 5945, "token_acc": 0.5976346250629089, "train_speed(iter/s)": 0.225763 }, { "epoch": 2.2919876733436055, "grad_norm": 0.8121992945671082, "learning_rate": 1.8090530683759718e-05, "loss": 1.7822078704833983, "memory(GiB)": 136.87, "step": 5950, "token_acc": 0.5799952595401754, "train_speed(iter/s)": 0.225573 }, { "epoch": 2.2939137134052388, "grad_norm": 0.6728527545928955, "learning_rate": 1.7997253993782757e-05, "loss": 1.7837051391601562, "memory(GiB)": 136.87, "step": 5955, "token_acc": 0.5955346650998825, "train_speed(iter/s)": 0.225674 }, { "epoch": 2.295839753466872, "grad_norm": 0.7240466475486755, "learning_rate": 1.7904177934671222e-05, "loss": 1.7575838088989257, "memory(GiB)": 136.87, "step": 5960, "token_acc": 0.5828865058087578, "train_speed(iter/s)": 0.22553 }, { "epoch": 2.297765793528505, "grad_norm": 0.840474545955658, "learning_rate": 1.7811302926038152e-05, "loss": 1.6996446609497071, "memory(GiB)": 136.87, "step": 5965, "token_acc": 0.6212999694842845, "train_speed(iter/s)": 0.225632 }, { "epoch": 2.299691833590139, "grad_norm": 1.001343011856079, "learning_rate": 1.7718629386590106e-05, "loss": 1.794900894165039, "memory(GiB)": 136.87, "step": 5970, "token_acc": 0.5808986005401424, "train_speed(iter/s)": 0.225618 }, { "epoch": 2.301617873651772, "grad_norm": 0.9903811812400818, "learning_rate": 1.7626157734125397e-05, "loss": 1.7136863708496093, "memory(GiB)": 136.87, "step": 5975, "token_acc": 0.5898409684310467, "train_speed(iter/s)": 0.225719 }, { "epoch": 2.3035439137134053, "grad_norm": 0.73136305809021, "learning_rate": 1.7533888385532208e-05, "loss": 1.7575675964355468, "memory(GiB)": 136.87, "step": 5980, "token_acc": 0.5941320293398533, "train_speed(iter/s)": 0.225821 }, { "epoch": 2.3054699537750385, "grad_norm": 1.6091309785842896, "learning_rate": 1.744182175678663e-05, "loss": 1.758076286315918, "memory(GiB)": 136.87, "step": 5985, "token_acc": 0.5915687629578438, "train_speed(iter/s)": 0.225867 }, { "epoch": 2.3073959938366717, "grad_norm": 0.6056050658226013, "learning_rate": 1.7349958262950855e-05, "loss": 1.751551055908203, "memory(GiB)": 136.87, "step": 5990, "token_acc": 0.6008492569002123, "train_speed(iter/s)": 0.225967 }, { "epoch": 2.309322033898305, "grad_norm": 0.6723023056983948, "learning_rate": 1.725829831817132e-05, "loss": 1.7882888793945313, "memory(GiB)": 136.87, "step": 5995, "token_acc": 0.5942641173855047, "train_speed(iter/s)": 0.225917 }, { "epoch": 2.3112480739599386, "grad_norm": 0.8164248466491699, "learning_rate": 1.7166842335676732e-05, "loss": 1.7342914581298827, "memory(GiB)": 136.87, "step": 6000, "token_acc": 0.5949027498323273, "train_speed(iter/s)": 0.226011 }, { "epoch": 2.313174114021572, "grad_norm": 0.5911799073219299, "learning_rate": 1.7075590727776362e-05, "loss": 1.6702856063842773, "memory(GiB)": 136.87, "step": 6005, "token_acc": 0.5983926521239954, "train_speed(iter/s)": 0.22526 }, { "epoch": 2.315100154083205, "grad_norm": 0.9384279251098633, "learning_rate": 1.698454390585804e-05, "loss": 1.773263168334961, "memory(GiB)": 136.87, "step": 6010, "token_acc": 0.5634699562276164, "train_speed(iter/s)": 0.22536 }, { "epoch": 2.3170261941448382, "grad_norm": 1.1177493333816528, "learning_rate": 1.6893702280386363e-05, "loss": 1.7437713623046875, "memory(GiB)": 136.87, "step": 6015, "token_acc": 0.6100096711798839, "train_speed(iter/s)": 0.22546 }, { "epoch": 2.3189522342064715, "grad_norm": 0.838968813419342, "learning_rate": 1.6803066260900905e-05, "loss": 1.8066473007202148, "memory(GiB)": 136.87, "step": 6020, "token_acc": 0.5872020075282308, "train_speed(iter/s)": 0.225488 }, { "epoch": 2.3208782742681047, "grad_norm": 0.774046003818512, "learning_rate": 1.671263625601424e-05, "loss": 1.7300872802734375, "memory(GiB)": 136.87, "step": 6025, "token_acc": 0.6225204200700116, "train_speed(iter/s)": 0.225591 }, { "epoch": 2.322804314329738, "grad_norm": 0.9364326000213623, "learning_rate": 1.662241267341022e-05, "loss": 1.6646751403808593, "memory(GiB)": 136.87, "step": 6030, "token_acc": 0.5790805567271193, "train_speed(iter/s)": 0.225469 }, { "epoch": 2.324730354391371, "grad_norm": 0.8198605179786682, "learning_rate": 1.6532395919842084e-05, "loss": 1.7699329376220703, "memory(GiB)": 136.87, "step": 6035, "token_acc": 0.6019995239228755, "train_speed(iter/s)": 0.225571 }, { "epoch": 2.3266563944530048, "grad_norm": 0.7392686009407043, "learning_rate": 1.6442586401130574e-05, "loss": 1.7544296264648438, "memory(GiB)": 136.87, "step": 6040, "token_acc": 0.575739165654111, "train_speed(iter/s)": 0.225673 }, { "epoch": 2.328582434514638, "grad_norm": 1.1457183361053467, "learning_rate": 1.6352984522162253e-05, "loss": 1.8268362045288087, "memory(GiB)": 136.87, "step": 6045, "token_acc": 0.5639048038783605, "train_speed(iter/s)": 0.225473 }, { "epoch": 2.330508474576271, "grad_norm": 0.7890773415565491, "learning_rate": 1.626359068688747e-05, "loss": 1.7481292724609374, "memory(GiB)": 136.87, "step": 6050, "token_acc": 0.6093050999105278, "train_speed(iter/s)": 0.225574 }, { "epoch": 2.3324345146379044, "grad_norm": 1.0796722173690796, "learning_rate": 1.6174405298318776e-05, "loss": 1.7914886474609375, "memory(GiB)": 136.87, "step": 6055, "token_acc": 0.5848470363288719, "train_speed(iter/s)": 0.225438 }, { "epoch": 2.3343605546995376, "grad_norm": 1.3864635229110718, "learning_rate": 1.608542875852889e-05, "loss": 1.738632583618164, "memory(GiB)": 136.87, "step": 6060, "token_acc": 0.5878249841471148, "train_speed(iter/s)": 0.225536 }, { "epoch": 2.336286594761171, "grad_norm": 0.78621506690979, "learning_rate": 1.5996661468649017e-05, "loss": 1.7501712799072267, "memory(GiB)": 136.87, "step": 6065, "token_acc": 0.593601383484652, "train_speed(iter/s)": 0.225638 }, { "epoch": 2.3382126348228045, "grad_norm": 0.849509596824646, "learning_rate": 1.590810382886701e-05, "loss": 1.7106464385986329, "memory(GiB)": 136.87, "step": 6070, "token_acc": 0.610813041683863, "train_speed(iter/s)": 0.225544 }, { "epoch": 2.3401386748844377, "grad_norm": 1.2895069122314453, "learning_rate": 1.581975623842556e-05, "loss": 1.706148910522461, "memory(GiB)": 136.87, "step": 6075, "token_acc": 0.5795330171470267, "train_speed(iter/s)": 0.225643 }, { "epoch": 2.342064714946071, "grad_norm": 0.769138753414154, "learning_rate": 1.573161909562041e-05, "loss": 1.7505435943603516, "memory(GiB)": 136.87, "step": 6080, "token_acc": 0.6137651821862348, "train_speed(iter/s)": 0.225519 }, { "epoch": 2.343990755007704, "grad_norm": 1.3817111253738403, "learning_rate": 1.5643692797798516e-05, "loss": 1.8061553955078125, "memory(GiB)": 136.87, "step": 6085, "token_acc": 0.6187619307335697, "train_speed(iter/s)": 0.225617 }, { "epoch": 2.3459167950693374, "grad_norm": 0.9270229339599609, "learning_rate": 1.5555977741356282e-05, "loss": 1.7776214599609375, "memory(GiB)": 136.87, "step": 6090, "token_acc": 0.5748600746268657, "train_speed(iter/s)": 0.225446 }, { "epoch": 2.3478428351309706, "grad_norm": 1.0285189151763916, "learning_rate": 1.546847432173782e-05, "loss": 1.7487245559692384, "memory(GiB)": 136.87, "step": 6095, "token_acc": 0.5871774824081314, "train_speed(iter/s)": 0.225544 }, { "epoch": 2.349768875192604, "grad_norm": 3.281270980834961, "learning_rate": 1.5381182933433068e-05, "loss": 1.7786136627197267, "memory(GiB)": 136.87, "step": 6100, "token_acc": 0.593194625054183, "train_speed(iter/s)": 0.225642 }, { "epoch": 2.3516949152542375, "grad_norm": 0.7258989214897156, "learning_rate": 1.5294103969976125e-05, "loss": 1.7754228591918946, "memory(GiB)": 136.87, "step": 6105, "token_acc": 0.5885826771653543, "train_speed(iter/s)": 0.22548 }, { "epoch": 2.3536209553158707, "grad_norm": 0.728654146194458, "learning_rate": 1.5207237823943363e-05, "loss": 1.7477882385253907, "memory(GiB)": 136.87, "step": 6110, "token_acc": 0.5984008253804488, "train_speed(iter/s)": 0.22558 }, { "epoch": 2.355546995377504, "grad_norm": 1.178024172782898, "learning_rate": 1.5120584886951762e-05, "loss": 1.7573772430419923, "memory(GiB)": 136.87, "step": 6115, "token_acc": 0.6066613798572561, "train_speed(iter/s)": 0.225442 }, { "epoch": 2.357473035439137, "grad_norm": 0.8227279186248779, "learning_rate": 1.5034145549657083e-05, "loss": 1.7448158264160156, "memory(GiB)": 136.87, "step": 6120, "token_acc": 0.5971634735008708, "train_speed(iter/s)": 0.225544 }, { "epoch": 2.3593990755007703, "grad_norm": 0.6402755975723267, "learning_rate": 1.4947920201752077e-05, "loss": 1.7440561294555663, "memory(GiB)": 136.87, "step": 6125, "token_acc": 0.5971577726218097, "train_speed(iter/s)": 0.225642 }, { "epoch": 2.3613251155624035, "grad_norm": 0.6562501192092896, "learning_rate": 1.4861909231964843e-05, "loss": 1.7098701477050782, "memory(GiB)": 136.87, "step": 6130, "token_acc": 0.5955671447196871, "train_speed(iter/s)": 0.225484 }, { "epoch": 2.363251155624037, "grad_norm": 0.7249884009361267, "learning_rate": 1.4776113028056953e-05, "loss": 1.7917041778564453, "memory(GiB)": 136.87, "step": 6135, "token_acc": 0.5886325267304445, "train_speed(iter/s)": 0.225581 }, { "epoch": 2.3651771956856704, "grad_norm": 1.0918840169906616, "learning_rate": 1.4690531976821742e-05, "loss": 1.7397417068481444, "memory(GiB)": 136.87, "step": 6140, "token_acc": 0.5955414012738853, "train_speed(iter/s)": 0.225479 }, { "epoch": 2.3671032357473036, "grad_norm": 0.8833898901939392, "learning_rate": 1.4605166464082637e-05, "loss": 1.7727884292602538, "memory(GiB)": 136.87, "step": 6145, "token_acc": 0.5727510087823404, "train_speed(iter/s)": 0.225577 }, { "epoch": 2.369029275808937, "grad_norm": 0.7825679183006287, "learning_rate": 1.4520016874691289e-05, "loss": 1.7732353210449219, "memory(GiB)": 136.87, "step": 6150, "token_acc": 0.5803498779495525, "train_speed(iter/s)": 0.225406 }, { "epoch": 2.37095531587057, "grad_norm": 0.5326597690582275, "learning_rate": 1.4435083592525954e-05, "loss": 1.7631011962890626, "memory(GiB)": 136.87, "step": 6155, "token_acc": 0.6136307918607502, "train_speed(iter/s)": 0.225503 }, { "epoch": 2.3728813559322033, "grad_norm": 1.886215329170227, "learning_rate": 1.4350367000489716e-05, "loss": 1.7412738800048828, "memory(GiB)": 136.87, "step": 6160, "token_acc": 0.5984, "train_speed(iter/s)": 0.225602 }, { "epoch": 2.3748073959938365, "grad_norm": 0.8209748864173889, "learning_rate": 1.4265867480508704e-05, "loss": 1.7805303573608398, "memory(GiB)": 136.87, "step": 6165, "token_acc": 0.5844707988364287, "train_speed(iter/s)": 0.225511 }, { "epoch": 2.3767334360554697, "grad_norm": 0.9563490152359009, "learning_rate": 1.4181585413530498e-05, "loss": 1.7138477325439454, "memory(GiB)": 136.87, "step": 6170, "token_acc": 0.6115280696487542, "train_speed(iter/s)": 0.22561 }, { "epoch": 2.3786594761171034, "grad_norm": 0.6651891469955444, "learning_rate": 1.4097521179522275e-05, "loss": 1.7427173614501954, "memory(GiB)": 136.87, "step": 6175, "token_acc": 0.6088790678987546, "train_speed(iter/s)": 0.225424 }, { "epoch": 2.3805855161787366, "grad_norm": 0.8884119391441345, "learning_rate": 1.4013675157469221e-05, "loss": 1.720941925048828, "memory(GiB)": 136.87, "step": 6180, "token_acc": 0.5826004278583313, "train_speed(iter/s)": 0.225524 }, { "epoch": 2.38251155624037, "grad_norm": 0.7243108749389648, "learning_rate": 1.3930047725372701e-05, "loss": 1.751499557495117, "memory(GiB)": 136.87, "step": 6185, "token_acc": 0.597666378565255, "train_speed(iter/s)": 0.22562 }, { "epoch": 2.384437596302003, "grad_norm": 0.9080860614776611, "learning_rate": 1.3846639260248643e-05, "loss": 1.7844144821166992, "memory(GiB)": 136.87, "step": 6190, "token_acc": 0.5806381118881119, "train_speed(iter/s)": 0.225561 }, { "epoch": 2.3863636363636362, "grad_norm": 0.7291045784950256, "learning_rate": 1.3763450138125813e-05, "loss": 1.7495555877685547, "memory(GiB)": 136.87, "step": 6195, "token_acc": 0.5659421818949145, "train_speed(iter/s)": 0.225657 }, { "epoch": 2.3882896764252695, "grad_norm": 0.7702904939651489, "learning_rate": 1.368048073404412e-05, "loss": 1.7903865814208983, "memory(GiB)": 136.87, "step": 6200, "token_acc": 0.5870870870870871, "train_speed(iter/s)": 0.225496 }, { "epoch": 2.390215716486903, "grad_norm": 0.9907333254814148, "learning_rate": 1.359773142205293e-05, "loss": 1.7470645904541016, "memory(GiB)": 136.87, "step": 6205, "token_acc": 0.6155070486584812, "train_speed(iter/s)": 0.225591 }, { "epoch": 2.3921417565485363, "grad_norm": 0.8636792302131653, "learning_rate": 1.351520257520935e-05, "loss": 1.7163467407226562, "memory(GiB)": 136.87, "step": 6210, "token_acc": 0.5800691244239631, "train_speed(iter/s)": 0.225355 }, { "epoch": 2.3940677966101696, "grad_norm": 1.0127636194229126, "learning_rate": 1.3432894565576552e-05, "loss": 1.7046619415283204, "memory(GiB)": 136.87, "step": 6215, "token_acc": 0.6136825468503048, "train_speed(iter/s)": 0.22545 }, { "epoch": 2.3959938366718028, "grad_norm": 1.10391104221344, "learning_rate": 1.3350807764222178e-05, "loss": 1.7188854217529297, "memory(GiB)": 136.87, "step": 6220, "token_acc": 0.606425702811245, "train_speed(iter/s)": 0.225547 }, { "epoch": 2.397919876733436, "grad_norm": 0.7892981171607971, "learning_rate": 1.3268942541216522e-05, "loss": 1.7245141983032226, "memory(GiB)": 136.87, "step": 6225, "token_acc": 0.6054570259208731, "train_speed(iter/s)": 0.225414 }, { "epoch": 2.399845916795069, "grad_norm": 0.9871103167533875, "learning_rate": 1.3187299265631017e-05, "loss": 1.8419445037841797, "memory(GiB)": 136.87, "step": 6230, "token_acc": 0.5904173106646059, "train_speed(iter/s)": 0.22551 }, { "epoch": 2.4017719568567024, "grad_norm": 0.9012895226478577, "learning_rate": 1.3105878305536418e-05, "loss": 1.7545204162597656, "memory(GiB)": 136.87, "step": 6235, "token_acc": 0.597794696770806, "train_speed(iter/s)": 0.225419 }, { "epoch": 2.403697996918336, "grad_norm": 0.6132038831710815, "learning_rate": 1.3024680028001272e-05, "loss": 1.739631462097168, "memory(GiB)": 136.87, "step": 6240, "token_acc": 0.5967777052035707, "train_speed(iter/s)": 0.225515 }, { "epoch": 2.4056240369799693, "grad_norm": 0.8217525482177734, "learning_rate": 1.2943704799090226e-05, "loss": 1.7895318984985351, "memory(GiB)": 136.87, "step": 6245, "token_acc": 0.5860901276374055, "train_speed(iter/s)": 0.225614 }, { "epoch": 2.4075500770416025, "grad_norm": 2.8082449436187744, "learning_rate": 1.2862952983862301e-05, "loss": 1.6853967666625977, "memory(GiB)": 136.87, "step": 6250, "token_acc": 0.6029850746268657, "train_speed(iter/s)": 0.225527 }, { "epoch": 2.4094761171032357, "grad_norm": 0.7878751158714294, "learning_rate": 1.2782424946369324e-05, "loss": 1.7052642822265625, "memory(GiB)": 136.87, "step": 6255, "token_acc": 0.6001275510204082, "train_speed(iter/s)": 0.225625 }, { "epoch": 2.411402157164869, "grad_norm": 1.1741511821746826, "learning_rate": 1.2702121049654319e-05, "loss": 1.7604766845703126, "memory(GiB)": 136.87, "step": 6260, "token_acc": 0.5685633311532592, "train_speed(iter/s)": 0.225448 }, { "epoch": 2.413328197226502, "grad_norm": 1.878864049911499, "learning_rate": 1.2622041655749754e-05, "loss": 1.7939418792724608, "memory(GiB)": 136.87, "step": 6265, "token_acc": 0.5861340503168811, "train_speed(iter/s)": 0.225546 }, { "epoch": 2.415254237288136, "grad_norm": 1.1127411127090454, "learning_rate": 1.254218712567603e-05, "loss": 1.772989845275879, "memory(GiB)": 136.87, "step": 6270, "token_acc": 0.5840864007053119, "train_speed(iter/s)": 0.225496 }, { "epoch": 2.417180277349769, "grad_norm": 1.7507178783416748, "learning_rate": 1.2462557819439745e-05, "loss": 1.786292839050293, "memory(GiB)": 136.87, "step": 6275, "token_acc": 0.5905109489051095, "train_speed(iter/s)": 0.225593 }, { "epoch": 2.4191063174114023, "grad_norm": 0.6418553590774536, "learning_rate": 1.2383154096032175e-05, "loss": 1.7871992111206054, "memory(GiB)": 136.87, "step": 6280, "token_acc": 0.5720430107526882, "train_speed(iter/s)": 0.225691 }, { "epoch": 2.4210323574730355, "grad_norm": 0.7897877097129822, "learning_rate": 1.230397631342759e-05, "loss": 1.7533956527709962, "memory(GiB)": 136.87, "step": 6285, "token_acc": 0.5893360676749552, "train_speed(iter/s)": 0.225534 }, { "epoch": 2.4229583975346687, "grad_norm": 0.8859832286834717, "learning_rate": 1.2225024828581622e-05, "loss": 1.7505607604980469, "memory(GiB)": 136.87, "step": 6290, "token_acc": 0.5698396275219866, "train_speed(iter/s)": 0.225631 }, { "epoch": 2.424884437596302, "grad_norm": 0.7162906527519226, "learning_rate": 1.2146299997429749e-05, "loss": 1.765916633605957, "memory(GiB)": 136.87, "step": 6295, "token_acc": 0.6060606060606061, "train_speed(iter/s)": 0.225552 }, { "epoch": 2.426810477657935, "grad_norm": 1.2338824272155762, "learning_rate": 1.2067802174885589e-05, "loss": 1.7982860565185548, "memory(GiB)": 136.87, "step": 6300, "token_acc": 0.5928631051752922, "train_speed(iter/s)": 0.225649 }, { "epoch": 2.4287365177195683, "grad_norm": 1.0062686204910278, "learning_rate": 1.1989531714839318e-05, "loss": 1.687603759765625, "memory(GiB)": 136.87, "step": 6305, "token_acc": 0.5950574993883044, "train_speed(iter/s)": 0.225747 }, { "epoch": 2.430662557781202, "grad_norm": 0.8818328380584717, "learning_rate": 1.1911488970156176e-05, "loss": 1.7602195739746094, "memory(GiB)": 136.87, "step": 6310, "token_acc": 0.6067974578612877, "train_speed(iter/s)": 0.225563 }, { "epoch": 2.432588597842835, "grad_norm": 0.8212074041366577, "learning_rate": 1.183367429267472e-05, "loss": 1.788917350769043, "memory(GiB)": 136.87, "step": 6315, "token_acc": 0.6095283696432846, "train_speed(iter/s)": 0.225659 }, { "epoch": 2.4345146379044684, "grad_norm": 1.390724539756775, "learning_rate": 1.1756088033205373e-05, "loss": 1.7803215026855468, "memory(GiB)": 136.87, "step": 6320, "token_acc": 0.5860018298261666, "train_speed(iter/s)": 0.225553 }, { "epoch": 2.4364406779661016, "grad_norm": 1.1500554084777832, "learning_rate": 1.1678730541528744e-05, "loss": 1.7168159484863281, "memory(GiB)": 136.87, "step": 6325, "token_acc": 0.5908160280783855, "train_speed(iter/s)": 0.22565 }, { "epoch": 2.438366718027735, "grad_norm": 0.8661229014396667, "learning_rate": 1.160160216639411e-05, "loss": 1.7641899108886718, "memory(GiB)": 136.87, "step": 6330, "token_acc": 0.5784013204432916, "train_speed(iter/s)": 0.225461 }, { "epoch": 2.440292758089368, "grad_norm": 0.8414490818977356, "learning_rate": 1.1524703255517854e-05, "loss": 1.7607059478759766, "memory(GiB)": 136.87, "step": 6335, "token_acc": 0.592836946277097, "train_speed(iter/s)": 0.225558 }, { "epoch": 2.4422187981510017, "grad_norm": 1.1226396560668945, "learning_rate": 1.1448034155581808e-05, "loss": 1.7241291046142577, "memory(GiB)": 136.87, "step": 6340, "token_acc": 0.5854690221448121, "train_speed(iter/s)": 0.225654 }, { "epoch": 2.444144838212635, "grad_norm": 0.6753987073898315, "learning_rate": 1.1371595212231814e-05, "loss": 1.7629899978637695, "memory(GiB)": 136.87, "step": 6345, "token_acc": 0.6034912718204489, "train_speed(iter/s)": 0.22549 }, { "epoch": 2.446070878274268, "grad_norm": 0.8329557776451111, "learning_rate": 1.1295386770076064e-05, "loss": 1.7341716766357422, "memory(GiB)": 136.87, "step": 6350, "token_acc": 0.5967302452316077, "train_speed(iter/s)": 0.225585 }, { "epoch": 2.4479969183359014, "grad_norm": 0.9416248798370361, "learning_rate": 1.1219409172683576e-05, "loss": 1.7593303680419923, "memory(GiB)": 136.87, "step": 6355, "token_acc": 0.6022029231095107, "train_speed(iter/s)": 0.225448 }, { "epoch": 2.4499229583975346, "grad_norm": 1.220937967300415, "learning_rate": 1.1143662762582711e-05, "loss": 1.6858165740966797, "memory(GiB)": 136.87, "step": 6360, "token_acc": 0.5952595259525952, "train_speed(iter/s)": 0.225546 }, { "epoch": 2.451848998459168, "grad_norm": 0.6591572761535645, "learning_rate": 1.1068147881259518e-05, "loss": 1.7599594116210937, "memory(GiB)": 136.87, "step": 6365, "token_acc": 0.5888540734109221, "train_speed(iter/s)": 0.22564 }, { "epoch": 2.453775038520801, "grad_norm": 0.840905487537384, "learning_rate": 1.0992864869156266e-05, "loss": 1.7216621398925782, "memory(GiB)": 136.87, "step": 6370, "token_acc": 0.5963777490297542, "train_speed(iter/s)": 0.225565 }, { "epoch": 2.4557010785824347, "grad_norm": 0.8095690011978149, "learning_rate": 1.0917814065669926e-05, "loss": 1.7725284576416016, "memory(GiB)": 136.87, "step": 6375, "token_acc": 0.6178283546704599, "train_speed(iter/s)": 0.225657 }, { "epoch": 2.457627118644068, "grad_norm": 0.8278321027755737, "learning_rate": 1.084299580915054e-05, "loss": 1.7619709014892577, "memory(GiB)": 136.87, "step": 6380, "token_acc": 0.5774442359808214, "train_speed(iter/s)": 0.225513 }, { "epoch": 2.459553158705701, "grad_norm": 1.1755812168121338, "learning_rate": 1.0768410436899836e-05, "loss": 1.768560791015625, "memory(GiB)": 136.87, "step": 6385, "token_acc": 0.6030060120240481, "train_speed(iter/s)": 0.225609 }, { "epoch": 2.4614791987673343, "grad_norm": 1.2380053997039795, "learning_rate": 1.069405828516956e-05, "loss": 1.8089324951171875, "memory(GiB)": 136.87, "step": 6390, "token_acc": 0.5924847072531314, "train_speed(iter/s)": 0.225513 }, { "epoch": 2.4634052388289676, "grad_norm": 0.9368924498558044, "learning_rate": 1.0619939689160114e-05, "loss": 1.7379064559936523, "memory(GiB)": 136.87, "step": 6395, "token_acc": 0.5945629932768196, "train_speed(iter/s)": 0.225609 }, { "epoch": 2.4653312788906008, "grad_norm": 1.3306682109832764, "learning_rate": 1.0546054983018908e-05, "loss": 1.732640266418457, "memory(GiB)": 136.87, "step": 6400, "token_acc": 0.5804279874969944, "train_speed(iter/s)": 0.225704 }, { "epoch": 2.4672573189522344, "grad_norm": 0.7077586054801941, "learning_rate": 1.0472404499838912e-05, "loss": 1.7971107482910156, "memory(GiB)": 136.87, "step": 6405, "token_acc": 0.5892661555312158, "train_speed(iter/s)": 0.225555 }, { "epoch": 2.4691833590138677, "grad_norm": 0.7110083699226379, "learning_rate": 1.0398988571657171e-05, "loss": 1.7382835388183593, "memory(GiB)": 136.87, "step": 6410, "token_acc": 0.5823636363636364, "train_speed(iter/s)": 0.225648 }, { "epoch": 2.471109399075501, "grad_norm": 0.6605734825134277, "learning_rate": 1.0325807529453307e-05, "loss": 1.7629478454589844, "memory(GiB)": 136.87, "step": 6415, "token_acc": 0.5946843853820598, "train_speed(iter/s)": 0.2255 }, { "epoch": 2.473035439137134, "grad_norm": 0.9854040145874023, "learning_rate": 1.0252861703148e-05, "loss": 1.7683237075805665, "memory(GiB)": 136.87, "step": 6420, "token_acc": 0.6104114189756508, "train_speed(iter/s)": 0.225596 }, { "epoch": 2.4749614791987673, "grad_norm": 0.8552939295768738, "learning_rate": 1.0180151421601482e-05, "loss": 1.7265308380126954, "memory(GiB)": 136.87, "step": 6425, "token_acc": 0.592092803030303, "train_speed(iter/s)": 0.225691 }, { "epoch": 2.4768875192604005, "grad_norm": 2.8793365955352783, "learning_rate": 1.0107677012612087e-05, "loss": 1.7507991790771484, "memory(GiB)": 136.87, "step": 6430, "token_acc": 0.6297085998578535, "train_speed(iter/s)": 0.22553 }, { "epoch": 2.4788135593220337, "grad_norm": 1.5658791065216064, "learning_rate": 1.0035438802914826e-05, "loss": 1.769890594482422, "memory(GiB)": 136.87, "step": 6435, "token_acc": 0.5688343558282208, "train_speed(iter/s)": 0.225623 }, { "epoch": 2.480739599383667, "grad_norm": 0.9001925587654114, "learning_rate": 9.963437118179778e-06, "loss": 1.7269010543823242, "memory(GiB)": 136.87, "step": 6440, "token_acc": 0.6007955161815224, "train_speed(iter/s)": 0.225469 }, { "epoch": 2.4826656394453006, "grad_norm": 0.9512019753456116, "learning_rate": 9.891672283010773e-06, "loss": 1.7166770935058593, "memory(GiB)": 136.87, "step": 6445, "token_acc": 0.5868338557993731, "train_speed(iter/s)": 0.225564 }, { "epoch": 2.484591679506934, "grad_norm": 0.8464173674583435, "learning_rate": 9.820144620943792e-06, "loss": 1.7656770706176759, "memory(GiB)": 136.87, "step": 6450, "token_acc": 0.5673964653125825, "train_speed(iter/s)": 0.225359 }, { "epoch": 2.486517719568567, "grad_norm": 1.2672311067581177, "learning_rate": 9.74885445444562e-06, "loss": 1.7996238708496093, "memory(GiB)": 136.87, "step": 6455, "token_acc": 0.6024713682941532, "train_speed(iter/s)": 0.225451 }, { "epoch": 2.4884437596302003, "grad_norm": 0.8195527195930481, "learning_rate": 9.677802104912348e-06, "loss": 1.7584362030029297, "memory(GiB)": 136.87, "step": 6460, "token_acc": 0.5970344526820759, "train_speed(iter/s)": 0.225545 }, { "epoch": 2.4903697996918335, "grad_norm": 2.4658055305480957, "learning_rate": 9.606987892667868e-06, "loss": 1.8002706527709962, "memory(GiB)": 136.87, "step": 6465, "token_acc": 0.5632160392798691, "train_speed(iter/s)": 0.225377 }, { "epoch": 2.4922958397534667, "grad_norm": 0.6704517602920532, "learning_rate": 9.536412136962553e-06, "loss": 1.716069793701172, "memory(GiB)": 136.87, "step": 6470, "token_acc": 0.6033632286995516, "train_speed(iter/s)": 0.225471 }, { "epoch": 2.4942218798151004, "grad_norm": 1.9474087953567505, "learning_rate": 9.466075155971692e-06, "loss": 1.6798561096191407, "memory(GiB)": 136.87, "step": 6475, "token_acc": 0.5969060773480663, "train_speed(iter/s)": 0.225306 }, { "epoch": 2.4961479198767336, "grad_norm": 0.9735795259475708, "learning_rate": 9.395977266794114e-06, "loss": 1.7014467239379882, "memory(GiB)": 136.87, "step": 6480, "token_acc": 0.599007561436673, "train_speed(iter/s)": 0.2254 }, { "epoch": 2.498073959938367, "grad_norm": 0.8462166786193848, "learning_rate": 9.326118785450804e-06, "loss": 1.7425146102905273, "memory(GiB)": 136.87, "step": 6485, "token_acc": 0.5804161566707466, "train_speed(iter/s)": 0.225492 }, { "epoch": 2.5, "grad_norm": 0.8482344746589661, "learning_rate": 9.25650002688337e-06, "loss": 1.7154478073120116, "memory(GiB)": 136.87, "step": 6490, "token_acc": 0.607293868921776, "train_speed(iter/s)": 0.225466 }, { "epoch": 2.501926040061633, "grad_norm": 1.1678473949432373, "learning_rate": 9.187121304952723e-06, "loss": 1.7428579330444336, "memory(GiB)": 136.87, "step": 6495, "token_acc": 0.5804252998909487, "train_speed(iter/s)": 0.22556 }, { "epoch": 2.5038520801232664, "grad_norm": 0.6760681867599487, "learning_rate": 9.117982932437616e-06, "loss": 1.7458980560302735, "memory(GiB)": 136.87, "step": 6500, "token_acc": 0.5954116638078902, "train_speed(iter/s)": 0.225455 }, { "epoch": 2.5057781201848996, "grad_norm": 0.6083308458328247, "learning_rate": 9.04908522103321e-06, "loss": 1.711414909362793, "memory(GiB)": 136.87, "step": 6505, "token_acc": 0.5895454545454546, "train_speed(iter/s)": 0.225546 }, { "epoch": 2.507704160246533, "grad_norm": 0.8596079349517822, "learning_rate": 8.980428481349743e-06, "loss": 1.8009174346923829, "memory(GiB)": 136.87, "step": 6510, "token_acc": 0.5869609232638185, "train_speed(iter/s)": 0.225289 }, { "epoch": 2.5096302003081665, "grad_norm": 0.7582442164421082, "learning_rate": 8.912013022911044e-06, "loss": 1.73724422454834, "memory(GiB)": 136.87, "step": 6515, "token_acc": 0.5835345773874863, "train_speed(iter/s)": 0.225377 }, { "epoch": 2.5115562403697997, "grad_norm": 0.7155218720436096, "learning_rate": 8.84383915415319e-06, "loss": 1.7769826889038085, "memory(GiB)": 136.87, "step": 6520, "token_acc": 0.5947270181987867, "train_speed(iter/s)": 0.225468 }, { "epoch": 2.513482280431433, "grad_norm": 0.9613110423088074, "learning_rate": 8.775907182423132e-06, "loss": 1.7796913146972657, "memory(GiB)": 136.87, "step": 6525, "token_acc": 0.6020818547433168, "train_speed(iter/s)": 0.225322 }, { "epoch": 2.515408320493066, "grad_norm": 0.8941595554351807, "learning_rate": 8.708217413977225e-06, "loss": 1.707906150817871, "memory(GiB)": 136.87, "step": 6530, "token_acc": 0.6147216398788726, "train_speed(iter/s)": 0.225414 }, { "epoch": 2.5173343605546994, "grad_norm": 1.1471151113510132, "learning_rate": 8.64077015397996e-06, "loss": 1.774416732788086, "memory(GiB)": 136.87, "step": 6535, "token_acc": 0.5963346997829756, "train_speed(iter/s)": 0.225336 }, { "epoch": 2.519260400616333, "grad_norm": 1.2513980865478516, "learning_rate": 8.573565706502529e-06, "loss": 1.7384067535400392, "memory(GiB)": 136.87, "step": 6540, "token_acc": 0.5839352155832787, "train_speed(iter/s)": 0.225428 }, { "epoch": 2.5211864406779663, "grad_norm": 0.7317337989807129, "learning_rate": 8.506604374521395e-06, "loss": 1.7558183670043945, "memory(GiB)": 136.87, "step": 6545, "token_acc": 0.5778357235984355, "train_speed(iter/s)": 0.22552 }, { "epoch": 2.5231124807395995, "grad_norm": 1.2270808219909668, "learning_rate": 8.439886459917064e-06, "loss": 1.7726566314697265, "memory(GiB)": 136.87, "step": 6550, "token_acc": 0.6090658076392085, "train_speed(iter/s)": 0.225358 }, { "epoch": 2.5250385208012327, "grad_norm": 0.758371114730835, "learning_rate": 8.373412263472581e-06, "loss": 1.7376522064208983, "memory(GiB)": 136.87, "step": 6555, "token_acc": 0.6021108179419525, "train_speed(iter/s)": 0.225452 }, { "epoch": 2.526964560862866, "grad_norm": 0.8149104714393616, "learning_rate": 8.307182084872313e-06, "loss": 1.7415027618408203, "memory(GiB)": 136.87, "step": 6560, "token_acc": 0.596769456681351, "train_speed(iter/s)": 0.225274 }, { "epoch": 2.528890600924499, "grad_norm": 0.8776388168334961, "learning_rate": 8.241196222700475e-06, "loss": 1.7876569747924804, "memory(GiB)": 136.87, "step": 6565, "token_acc": 0.6002169785733659, "train_speed(iter/s)": 0.225364 }, { "epoch": 2.5308166409861323, "grad_norm": 0.7386429905891418, "learning_rate": 8.175454974439826e-06, "loss": 1.7575851440429688, "memory(GiB)": 136.87, "step": 6570, "token_acc": 0.5849456665783196, "train_speed(iter/s)": 0.225277 }, { "epoch": 2.5327426810477656, "grad_norm": 2.3658864498138428, "learning_rate": 8.10995863647037e-06, "loss": 1.757291603088379, "memory(GiB)": 136.87, "step": 6575, "token_acc": 0.6094100074682599, "train_speed(iter/s)": 0.22537 }, { "epoch": 2.5346687211093992, "grad_norm": 0.7592331171035767, "learning_rate": 8.044707504067987e-06, "loss": 1.767623519897461, "memory(GiB)": 136.87, "step": 6580, "token_acc": 0.595243932336357, "train_speed(iter/s)": 0.22546 }, { "epoch": 2.5365947611710324, "grad_norm": 0.724601686000824, "learning_rate": 7.979701871403095e-06, "loss": 1.7439268112182618, "memory(GiB)": 136.87, "step": 6585, "token_acc": 0.5912841670964415, "train_speed(iter/s)": 0.225285 }, { "epoch": 2.5385208012326657, "grad_norm": 1.1232019662857056, "learning_rate": 7.914942031539307e-06, "loss": 1.7299232482910156, "memory(GiB)": 136.87, "step": 6590, "token_acc": 0.6041354510038958, "train_speed(iter/s)": 0.225379 }, { "epoch": 2.540446841294299, "grad_norm": 0.7735335826873779, "learning_rate": 7.850428276432149e-06, "loss": 1.7614971160888673, "memory(GiB)": 136.87, "step": 6595, "token_acc": 0.5635476342032676, "train_speed(iter/s)": 0.225222 }, { "epoch": 2.542372881355932, "grad_norm": 0.8413936495780945, "learning_rate": 7.786160896927754e-06, "loss": 1.720973587036133, "memory(GiB)": 136.87, "step": 6600, "token_acc": 0.6176310043668122, "train_speed(iter/s)": 0.225312 }, { "epoch": 2.5442989214175658, "grad_norm": 1.5853021144866943, "learning_rate": 7.722140182761468e-06, "loss": 1.7770484924316405, "memory(GiB)": 136.87, "step": 6605, "token_acc": 0.5979178390545864, "train_speed(iter/s)": 0.225403 }, { "epoch": 2.546224961479199, "grad_norm": 0.8040251135826111, "learning_rate": 7.658366422556663e-06, "loss": 1.7803247451782227, "memory(GiB)": 136.87, "step": 6610, "token_acc": 0.5691806836679327, "train_speed(iter/s)": 0.225277 }, { "epoch": 2.548151001540832, "grad_norm": 0.6319120526313782, "learning_rate": 7.594839903823321e-06, "loss": 1.7763856887817382, "memory(GiB)": 136.87, "step": 6615, "token_acc": 0.5823383644965082, "train_speed(iter/s)": 0.225371 }, { "epoch": 2.5500770416024654, "grad_norm": 0.789165735244751, "learning_rate": 7.531560912956835e-06, "loss": 1.7056188583374023, "memory(GiB)": 136.87, "step": 6620, "token_acc": 0.6102923411452041, "train_speed(iter/s)": 0.225286 }, { "epoch": 2.5520030816640986, "grad_norm": 0.6790891289710999, "learning_rate": 7.4685297352366234e-06, "loss": 1.690250778198242, "memory(GiB)": 136.87, "step": 6625, "token_acc": 0.6201143946615825, "train_speed(iter/s)": 0.225379 }, { "epoch": 2.553929121725732, "grad_norm": 1.8280107975006104, "learning_rate": 7.405746654824935e-06, "loss": 1.7029668807983398, "memory(GiB)": 136.87, "step": 6630, "token_acc": 0.6112143742255266, "train_speed(iter/s)": 0.225252 }, { "epoch": 2.555855161787365, "grad_norm": 0.7156417369842529, "learning_rate": 7.343211954765526e-06, "loss": 1.7556230545043945, "memory(GiB)": 136.87, "step": 6635, "token_acc": 0.6034425686858657, "train_speed(iter/s)": 0.225343 }, { "epoch": 2.5577812018489983, "grad_norm": 0.9100439548492432, "learning_rate": 7.280925916982359e-06, "loss": 1.7820247650146483, "memory(GiB)": 136.87, "step": 6640, "token_acc": 0.5686700458604875, "train_speed(iter/s)": 0.225392 }, { "epoch": 2.5597072419106315, "grad_norm": 0.606620192527771, "learning_rate": 7.218888822278349e-06, "loss": 1.7377914428710937, "memory(GiB)": 136.87, "step": 6645, "token_acc": 0.57930411206507, "train_speed(iter/s)": 0.225237 }, { "epoch": 2.561633281972265, "grad_norm": 0.6664561629295349, "learning_rate": 7.157100950334159e-06, "loss": 1.7779190063476562, "memory(GiB)": 136.87, "step": 6650, "token_acc": 0.5969325153374233, "train_speed(iter/s)": 0.225286 }, { "epoch": 2.5635593220338984, "grad_norm": 1.4106212854385376, "learning_rate": 7.095562579706817e-06, "loss": 1.765465545654297, "memory(GiB)": 136.87, "step": 6655, "token_acc": 0.5987389659520808, "train_speed(iter/s)": 0.225188 }, { "epoch": 2.5654853620955316, "grad_norm": 2.486879587173462, "learning_rate": 7.034273987828591e-06, "loss": 1.7376438140869142, "memory(GiB)": 136.87, "step": 6660, "token_acc": 0.6282894736842105, "train_speed(iter/s)": 0.225242 }, { "epoch": 2.567411402157165, "grad_norm": 0.8558741211891174, "learning_rate": 6.97323545100563e-06, "loss": 1.7216110229492188, "memory(GiB)": 136.87, "step": 6665, "token_acc": 0.5907345789608395, "train_speed(iter/s)": 0.225333 }, { "epoch": 2.569337442218798, "grad_norm": 0.595890998840332, "learning_rate": 6.912447244416794e-06, "loss": 1.7243354797363282, "memory(GiB)": 136.87, "step": 6670, "token_acc": 0.617708880714661, "train_speed(iter/s)": 0.22518 }, { "epoch": 2.5712634822804317, "grad_norm": 0.7160053253173828, "learning_rate": 6.851909642112387e-06, "loss": 1.7192840576171875, "memory(GiB)": 136.87, "step": 6675, "token_acc": 0.6142281879194631, "train_speed(iter/s)": 0.225272 }, { "epoch": 2.573189522342065, "grad_norm": 0.6273704171180725, "learning_rate": 6.7916229170128795e-06, "loss": 1.69462890625, "memory(GiB)": 136.87, "step": 6680, "token_acc": 0.6033733708152312, "train_speed(iter/s)": 0.225148 }, { "epoch": 2.575115562403698, "grad_norm": 0.6916431188583374, "learning_rate": 6.7315873409077714e-06, "loss": 1.7108070373535156, "memory(GiB)": 136.87, "step": 6685, "token_acc": 0.6030690537084399, "train_speed(iter/s)": 0.225239 }, { "epoch": 2.5770416024653313, "grad_norm": 0.8680840730667114, "learning_rate": 6.671803184454269e-06, "loss": 1.7325355529785156, "memory(GiB)": 136.87, "step": 6690, "token_acc": 0.5755029284441049, "train_speed(iter/s)": 0.22506 }, { "epoch": 2.5789676425269645, "grad_norm": 0.9855715036392212, "learning_rate": 6.612270717176106e-06, "loss": 1.7241365432739257, "memory(GiB)": 136.87, "step": 6695, "token_acc": 0.6001224739742804, "train_speed(iter/s)": 0.225151 }, { "epoch": 2.5808936825885977, "grad_norm": 0.7629043459892273, "learning_rate": 6.552990207462382e-06, "loss": 1.7361721038818358, "memory(GiB)": 136.87, "step": 6700, "token_acc": 0.5975510204081632, "train_speed(iter/s)": 0.22524 }, { "epoch": 2.582819722650231, "grad_norm": 0.7211050987243652, "learning_rate": 6.493961922566239e-06, "loss": 1.7221599578857423, "memory(GiB)": 136.87, "step": 6705, "token_acc": 0.6065820606582061, "train_speed(iter/s)": 0.22511 }, { "epoch": 2.584745762711864, "grad_norm": 0.7319083213806152, "learning_rate": 6.435186128603762e-06, "loss": 1.7586380004882813, "memory(GiB)": 136.87, "step": 6710, "token_acc": 0.6046454163577959, "train_speed(iter/s)": 0.225171 }, { "epoch": 2.586671802773498, "grad_norm": 0.733749270439148, "learning_rate": 6.37666309055273e-06, "loss": 1.757882308959961, "memory(GiB)": 136.87, "step": 6715, "token_acc": 0.5887734915924827, "train_speed(iter/s)": 0.225051 }, { "epoch": 2.588597842835131, "grad_norm": 0.793056070804596, "learning_rate": 6.318393072251398e-06, "loss": 1.7687044143676758, "memory(GiB)": 136.87, "step": 6720, "token_acc": 0.5741165672326756, "train_speed(iter/s)": 0.225094 }, { "epoch": 2.5905238828967643, "grad_norm": 0.863842785358429, "learning_rate": 6.26037633639738e-06, "loss": 1.7726699829101562, "memory(GiB)": 136.87, "step": 6725, "token_acc": 0.5722106360792493, "train_speed(iter/s)": 0.225185 }, { "epoch": 2.5924499229583975, "grad_norm": 1.0534777641296387, "learning_rate": 6.202613144546378e-06, "loss": 1.7395580291748047, "memory(GiB)": 136.87, "step": 6730, "token_acc": 0.605903470283207, "train_speed(iter/s)": 0.225139 }, { "epoch": 2.5943759630200307, "grad_norm": 0.8173394799232483, "learning_rate": 6.145103757111081e-06, "loss": 1.7583568572998047, "memory(GiB)": 136.87, "step": 6735, "token_acc": 0.5889648190331561, "train_speed(iter/s)": 0.225127 }, { "epoch": 2.5963020030816644, "grad_norm": 0.7020078301429749, "learning_rate": 6.087848433359945e-06, "loss": 1.7225908279418944, "memory(GiB)": 136.87, "step": 6740, "token_acc": 0.615927123126653, "train_speed(iter/s)": 0.225061 }, { "epoch": 2.5982280431432976, "grad_norm": 0.6174955368041992, "learning_rate": 6.03084743141602e-06, "loss": 1.7318885803222657, "memory(GiB)": 136.87, "step": 6745, "token_acc": 0.6050379065786256, "train_speed(iter/s)": 0.225017 }, { "epoch": 2.600154083204931, "grad_norm": 0.9957442879676819, "learning_rate": 5.974101008255815e-06, "loss": 1.770187759399414, "memory(GiB)": 136.87, "step": 6750, "token_acc": 0.6030195381882771, "train_speed(iter/s)": 0.224987 }, { "epoch": 2.602080123266564, "grad_norm": 0.6950587630271912, "learning_rate": 5.917609419708148e-06, "loss": 1.7540443420410157, "memory(GiB)": 136.87, "step": 6755, "token_acc": 0.5961683892109907, "train_speed(iter/s)": 0.225077 }, { "epoch": 2.6040061633281972, "grad_norm": 2.823882579803467, "learning_rate": 5.86137292045294e-06, "loss": 1.7139766693115235, "memory(GiB)": 136.87, "step": 6760, "token_acc": 0.6041039671682626, "train_speed(iter/s)": 0.225045 }, { "epoch": 2.6059322033898304, "grad_norm": 1.0858889818191528, "learning_rate": 5.8053917640201184e-06, "loss": 1.7562145233154296, "memory(GiB)": 136.87, "step": 6765, "token_acc": 0.592943654555029, "train_speed(iter/s)": 0.225026 }, { "epoch": 2.6078582434514637, "grad_norm": 2.0547709465026855, "learning_rate": 5.749666202788412e-06, "loss": 1.7477420806884765, "memory(GiB)": 136.87, "step": 6770, "token_acc": 0.5923703386198028, "train_speed(iter/s)": 0.224996 }, { "epoch": 2.609784283513097, "grad_norm": 1.2869744300842285, "learning_rate": 5.694196487984325e-06, "loss": 1.75133056640625, "memory(GiB)": 136.87, "step": 6775, "token_acc": 0.5837070254110612, "train_speed(iter/s)": 0.224937 }, { "epoch": 2.61171032357473, "grad_norm": 2.350369453430176, "learning_rate": 5.638982869680863e-06, "loss": 1.7174198150634765, "memory(GiB)": 136.87, "step": 6780, "token_acc": 0.5988914084152179, "train_speed(iter/s)": 0.224926 }, { "epoch": 2.6136363636363638, "grad_norm": 1.6764682531356812, "learning_rate": 5.584025596796536e-06, "loss": 1.7689947128295898, "memory(GiB)": 136.87, "step": 6785, "token_acc": 0.5922707523439287, "train_speed(iter/s)": 0.225015 }, { "epoch": 2.615562403697997, "grad_norm": 0.7412009835243225, "learning_rate": 5.529324917094125e-06, "loss": 1.6647150039672851, "memory(GiB)": 136.87, "step": 6790, "token_acc": 0.6217391304347826, "train_speed(iter/s)": 0.224958 }, { "epoch": 2.61748844375963, "grad_norm": 0.6097057461738586, "learning_rate": 5.474881077179653e-06, "loss": 1.7494089126586914, "memory(GiB)": 136.87, "step": 6795, "token_acc": 0.6094345150893642, "train_speed(iter/s)": 0.224907 }, { "epoch": 2.6194144838212634, "grad_norm": 1.9033492803573608, "learning_rate": 5.420694322501238e-06, "loss": 1.7284103393554688, "memory(GiB)": 136.87, "step": 6800, "token_acc": 0.5902812037493833, "train_speed(iter/s)": 0.224879 }, { "epoch": 2.6213405238828966, "grad_norm": 1.4216325283050537, "learning_rate": 5.366764897347963e-06, "loss": 1.7383384704589844, "memory(GiB)": 136.87, "step": 6805, "token_acc": 0.575491426181514, "train_speed(iter/s)": 0.224823 }, { "epoch": 2.6232665639445303, "grad_norm": 1.8279755115509033, "learning_rate": 5.313093044848796e-06, "loss": 1.7504913330078125, "memory(GiB)": 136.87, "step": 6810, "token_acc": 0.6075692151384303, "train_speed(iter/s)": 0.224855 }, { "epoch": 2.6251926040061635, "grad_norm": 0.6780545115470886, "learning_rate": 5.259679006971531e-06, "loss": 1.7905879974365235, "memory(GiB)": 136.87, "step": 6815, "token_acc": 0.5929549902152642, "train_speed(iter/s)": 0.224942 }, { "epoch": 2.6271186440677967, "grad_norm": 1.0205895900726318, "learning_rate": 5.206523024521612e-06, "loss": 1.75707950592041, "memory(GiB)": 136.87, "step": 6820, "token_acc": 0.5882657017317137, "train_speed(iter/s)": 0.224846 }, { "epoch": 2.62904468412943, "grad_norm": 2.8208160400390625, "learning_rate": 5.15362533714115e-06, "loss": 1.7804702758789062, "memory(GiB)": 136.87, "step": 6825, "token_acc": 0.5790851955307262, "train_speed(iter/s)": 0.224883 }, { "epoch": 2.630970724191063, "grad_norm": 0.7335540652275085, "learning_rate": 5.100986183307732e-06, "loss": 1.679723358154297, "memory(GiB)": 136.87, "step": 6830, "token_acc": 0.6034434879200222, "train_speed(iter/s)": 0.224802 }, { "epoch": 2.6328967642526964, "grad_norm": 1.5990538597106934, "learning_rate": 5.04860580033345e-06, "loss": 1.7369144439697266, "memory(GiB)": 136.87, "step": 6835, "token_acc": 0.6018219218336762, "train_speed(iter/s)": 0.224755 }, { "epoch": 2.6348228043143296, "grad_norm": 0.9568957686424255, "learning_rate": 4.996484424363776e-06, "loss": 1.757358932495117, "memory(GiB)": 136.87, "step": 6840, "token_acc": 0.6280649926144757, "train_speed(iter/s)": 0.224637 }, { "epoch": 2.636748844375963, "grad_norm": 0.7441213726997375, "learning_rate": 4.944622290376476e-06, "loss": 1.7873550415039063, "memory(GiB)": 136.87, "step": 6845, "token_acc": 0.5898576512455516, "train_speed(iter/s)": 0.224725 }, { "epoch": 2.6386748844375965, "grad_norm": 0.8088259696960449, "learning_rate": 4.893019632180619e-06, "loss": 1.7158393859863281, "memory(GiB)": 136.87, "step": 6850, "token_acc": 0.600619933237959, "train_speed(iter/s)": 0.224682 }, { "epoch": 2.6406009244992297, "grad_norm": 1.025926947593689, "learning_rate": 4.841676682415461e-06, "loss": 1.7305896759033204, "memory(GiB)": 136.87, "step": 6855, "token_acc": 0.6054216867469879, "train_speed(iter/s)": 0.224662 }, { "epoch": 2.642526964560863, "grad_norm": 0.8718918561935425, "learning_rate": 4.790593672549408e-06, "loss": 1.8130304336547851, "memory(GiB)": 136.87, "step": 6860, "token_acc": 0.5791065611912517, "train_speed(iter/s)": 0.224729 }, { "epoch": 2.644453004622496, "grad_norm": 1.4569692611694336, "learning_rate": 4.739770832879034e-06, "loss": 1.7960962295532226, "memory(GiB)": 136.87, "step": 6865, "token_acc": 0.5908096280087527, "train_speed(iter/s)": 0.224616 }, { "epoch": 2.6463790446841293, "grad_norm": 0.8462098836898804, "learning_rate": 4.6892083925279276e-06, "loss": 1.6946815490722655, "memory(GiB)": 136.87, "step": 6870, "token_acc": 0.5945823927765237, "train_speed(iter/s)": 0.224702 }, { "epoch": 2.648305084745763, "grad_norm": 0.6256276369094849, "learning_rate": 4.638906579445774e-06, "loss": 1.7373634338378907, "memory(GiB)": 136.87, "step": 6875, "token_acc": 0.6152321630804077, "train_speed(iter/s)": 0.224791 }, { "epoch": 2.650231124807396, "grad_norm": 2.569542646408081, "learning_rate": 4.588865620407265e-06, "loss": 1.7344160079956055, "memory(GiB)": 136.87, "step": 6880, "token_acc": 0.5941598614204405, "train_speed(iter/s)": 0.224613 }, { "epoch": 2.6521571648690294, "grad_norm": 0.5307633280754089, "learning_rate": 4.53908574101107e-06, "loss": 1.7948463439941407, "memory(GiB)": 136.87, "step": 6885, "token_acc": 0.5861264319049639, "train_speed(iter/s)": 0.2247 }, { "epoch": 2.6540832049306626, "grad_norm": 0.6971538662910461, "learning_rate": 4.489567165678867e-06, "loss": 1.7259840011596679, "memory(GiB)": 136.87, "step": 6890, "token_acc": 0.5853333333333334, "train_speed(iter/s)": 0.22459 }, { "epoch": 2.656009244992296, "grad_norm": 1.2193446159362793, "learning_rate": 4.440310117654264e-06, "loss": 1.8190689086914062, "memory(GiB)": 136.87, "step": 6895, "token_acc": 0.5909868796349116, "train_speed(iter/s)": 0.224678 }, { "epoch": 2.657935285053929, "grad_norm": 0.9335721731185913, "learning_rate": 4.3913148190018875e-06, "loss": 1.7426830291748048, "memory(GiB)": 136.87, "step": 6900, "token_acc": 0.5706609349811929, "train_speed(iter/s)": 0.224456 }, { "epoch": 2.6598613251155623, "grad_norm": 1.0697193145751953, "learning_rate": 4.342581490606269e-06, "loss": 1.6869901657104491, "memory(GiB)": 136.87, "step": 6905, "token_acc": 0.5847683725442638, "train_speed(iter/s)": 0.224543 }, { "epoch": 2.6617873651771955, "grad_norm": 0.8594087362289429, "learning_rate": 4.2941103521709215e-06, "loss": 1.7198274612426758, "memory(GiB)": 136.87, "step": 6910, "token_acc": 0.5775220040622884, "train_speed(iter/s)": 0.224632 }, { "epoch": 2.6637134052388287, "grad_norm": 1.301807165145874, "learning_rate": 4.245901622217343e-06, "loss": 1.7633750915527344, "memory(GiB)": 136.87, "step": 6915, "token_acc": 0.6019881475817244, "train_speed(iter/s)": 0.224483 }, { "epoch": 2.6656394453004624, "grad_norm": 0.8590920567512512, "learning_rate": 4.19795551808403e-06, "loss": 1.7495052337646484, "memory(GiB)": 136.87, "step": 6920, "token_acc": 0.5740461306316016, "train_speed(iter/s)": 0.224566 }, { "epoch": 2.6675654853620956, "grad_norm": 0.7486931085586548, "learning_rate": 4.150272255925451e-06, "loss": 1.7158809661865235, "memory(GiB)": 136.87, "step": 6925, "token_acc": 0.6221906789685356, "train_speed(iter/s)": 0.224421 }, { "epoch": 2.669491525423729, "grad_norm": 0.7119036316871643, "learning_rate": 4.102852050711148e-06, "loss": 1.698335838317871, "memory(GiB)": 136.87, "step": 6930, "token_acc": 0.5869154463863958, "train_speed(iter/s)": 0.224509 }, { "epoch": 2.671417565485362, "grad_norm": 7.528170585632324, "learning_rate": 4.055695116224688e-06, "loss": 1.7506807327270508, "memory(GiB)": 136.87, "step": 6935, "token_acc": 0.5712212315985901, "train_speed(iter/s)": 0.224596 }, { "epoch": 2.6733436055469952, "grad_norm": 0.8194499015808105, "learning_rate": 4.008801665062789e-06, "loss": 1.740778350830078, "memory(GiB)": 136.87, "step": 6940, "token_acc": 0.5935390549662488, "train_speed(iter/s)": 0.224484 }, { "epoch": 2.675269645608629, "grad_norm": 0.5649047493934631, "learning_rate": 3.962171908634265e-06, "loss": 1.719742202758789, "memory(GiB)": 136.87, "step": 6945, "token_acc": 0.5997064374082617, "train_speed(iter/s)": 0.22457 }, { "epoch": 2.677195685670262, "grad_norm": 0.6146143674850464, "learning_rate": 3.91580605715916e-06, "loss": 1.7335212707519532, "memory(GiB)": 136.87, "step": 6950, "token_acc": 0.5846676370693837, "train_speed(iter/s)": 0.224429 }, { "epoch": 2.6791217257318953, "grad_norm": 0.7810277342796326, "learning_rate": 3.869704319667732e-06, "loss": 1.7519798278808594, "memory(GiB)": 136.87, "step": 6955, "token_acc": 0.6102680829539706, "train_speed(iter/s)": 0.224514 }, { "epoch": 2.6810477657935285, "grad_norm": 1.1517738103866577, "learning_rate": 3.823866903999537e-06, "loss": 1.777420997619629, "memory(GiB)": 136.87, "step": 6960, "token_acc": 0.6020356234096692, "train_speed(iter/s)": 0.224339 }, { "epoch": 2.6829738058551618, "grad_norm": 0.8711195588111877, "learning_rate": 3.7782940168025195e-06, "loss": 1.7663118362426757, "memory(GiB)": 136.87, "step": 6965, "token_acc": 0.5815662397648541, "train_speed(iter/s)": 0.224425 }, { "epoch": 2.684899845916795, "grad_norm": 0.860407292842865, "learning_rate": 3.732985863532039e-06, "loss": 1.7647832870483398, "memory(GiB)": 136.87, "step": 6970, "token_acc": 0.584977033234261, "train_speed(iter/s)": 0.224511 }, { "epoch": 2.686825885978428, "grad_norm": 1.1411752700805664, "learning_rate": 3.687942648449967e-06, "loss": 1.7592964172363281, "memory(GiB)": 136.87, "step": 6975, "token_acc": 0.5915955351280368, "train_speed(iter/s)": 0.224327 }, { "epoch": 2.6887519260400614, "grad_norm": 0.5628349184989929, "learning_rate": 3.643164574623763e-06, "loss": 1.7299165725708008, "memory(GiB)": 136.87, "step": 6980, "token_acc": 0.5806138306138307, "train_speed(iter/s)": 0.224415 }, { "epoch": 2.690677966101695, "grad_norm": 0.6771619319915771, "learning_rate": 3.5986518439255142e-06, "loss": 1.7422441482543944, "memory(GiB)": 136.87, "step": 6985, "token_acc": 0.5721721721721722, "train_speed(iter/s)": 0.224209 }, { "epoch": 2.6926040061633283, "grad_norm": 0.6446504592895508, "learning_rate": 3.554404657031142e-06, "loss": 1.7097484588623046, "memory(GiB)": 136.87, "step": 6990, "token_acc": 0.6016360932077343, "train_speed(iter/s)": 0.224298 }, { "epoch": 2.6945300462249615, "grad_norm": 0.8920105695724487, "learning_rate": 3.5104232134193433e-06, "loss": 1.732600784301758, "memory(GiB)": 136.87, "step": 6995, "token_acc": 0.5957716701902749, "train_speed(iter/s)": 0.224384 }, { "epoch": 2.6964560862865947, "grad_norm": 1.0072287321090698, "learning_rate": 3.466707711370837e-06, "loss": 1.7058277130126953, "memory(GiB)": 136.87, "step": 7000, "token_acc": 0.6224467384142324, "train_speed(iter/s)": 0.224184 }, { "epoch": 2.698382126348228, "grad_norm": 0.6517560482025146, "learning_rate": 3.423258347967341e-06, "loss": 1.6760004043579102, "memory(GiB)": 136.87, "step": 7005, "token_acc": 0.6097101107706812, "train_speed(iter/s)": 0.224271 }, { "epoch": 2.7003081664098616, "grad_norm": 1.0025640726089478, "learning_rate": 3.380075319090799e-06, "loss": 1.7969295501708984, "memory(GiB)": 136.87, "step": 7010, "token_acc": 0.5955242436800663, "train_speed(iter/s)": 0.224193 }, { "epoch": 2.702234206471495, "grad_norm": 3.459596633911133, "learning_rate": 3.3371588194224257e-06, "loss": 1.7554845809936523, "memory(GiB)": 136.87, "step": 7015, "token_acc": 0.6044380125422094, "train_speed(iter/s)": 0.22428 }, { "epoch": 2.704160246533128, "grad_norm": 0.8395116925239563, "learning_rate": 3.294509042441815e-06, "loss": 1.7265501022338867, "memory(GiB)": 136.87, "step": 7020, "token_acc": 0.6165236051502145, "train_speed(iter/s)": 0.224019 }, { "epoch": 2.7060862865947612, "grad_norm": 0.618012011051178, "learning_rate": 3.252126180426161e-06, "loss": 1.7213024139404296, "memory(GiB)": 136.87, "step": 7025, "token_acc": 0.590729093873748, "train_speed(iter/s)": 0.224105 }, { "epoch": 2.7080123266563945, "grad_norm": 0.7261075377464294, "learning_rate": 3.2100104244492738e-06, "loss": 1.7258777618408203, "memory(GiB)": 136.87, "step": 7030, "token_acc": 0.6226053639846744, "train_speed(iter/s)": 0.224191 }, { "epoch": 2.7099383667180277, "grad_norm": 0.6725112199783325, "learning_rate": 3.168161964380807e-06, "loss": 1.7173175811767578, "memory(GiB)": 136.87, "step": 7035, "token_acc": 0.6363865758263941, "train_speed(iter/s)": 0.224128 }, { "epoch": 2.711864406779661, "grad_norm": 0.7794114351272583, "learning_rate": 3.1265809888853594e-06, "loss": 1.7100196838378907, "memory(GiB)": 136.87, "step": 7040, "token_acc": 0.5865485979337972, "train_speed(iter/s)": 0.224215 }, { "epoch": 2.713790446841294, "grad_norm": 5.177645206451416, "learning_rate": 3.0852676854216317e-06, "loss": 1.8419391632080078, "memory(GiB)": 136.87, "step": 7045, "token_acc": 0.5716099005711868, "train_speed(iter/s)": 0.224134 }, { "epoch": 2.7157164869029273, "grad_norm": 0.8293538689613342, "learning_rate": 3.0442222402415897e-06, "loss": 1.7724456787109375, "memory(GiB)": 136.87, "step": 7050, "token_acc": 0.610102015426723, "train_speed(iter/s)": 0.224219 }, { "epoch": 2.717642526964561, "grad_norm": 0.9767295122146606, "learning_rate": 3.0034448383896226e-06, "loss": 1.7477230072021483, "memory(GiB)": 136.87, "step": 7055, "token_acc": 0.6102189781021898, "train_speed(iter/s)": 0.224304 }, { "epoch": 2.719568567026194, "grad_norm": 0.8059224486351013, "learning_rate": 2.962935663701691e-06, "loss": 1.7339973449707031, "memory(GiB)": 136.87, "step": 7060, "token_acc": 0.6022085259373395, "train_speed(iter/s)": 0.224152 }, { "epoch": 2.7214946070878274, "grad_norm": 1.4882394075393677, "learning_rate": 2.9226948988045275e-06, "loss": 1.7846340179443358, "memory(GiB)": 136.87, "step": 7065, "token_acc": 0.6094908551655956, "train_speed(iter/s)": 0.224239 }, { "epoch": 2.7234206471494606, "grad_norm": 0.7999475598335266, "learning_rate": 2.882722725114792e-06, "loss": 1.6869220733642578, "memory(GiB)": 136.87, "step": 7070, "token_acc": 0.6184476940382452, "train_speed(iter/s)": 0.224135 }, { "epoch": 2.725346687211094, "grad_norm": 0.6292514801025391, "learning_rate": 2.8430193228382375e-06, "loss": 1.7308460235595704, "memory(GiB)": 136.87, "step": 7075, "token_acc": 0.6069711538461539, "train_speed(iter/s)": 0.224223 }, { "epoch": 2.7272727272727275, "grad_norm": 0.7574784755706787, "learning_rate": 2.8035848709689753e-06, "loss": 1.7337093353271484, "memory(GiB)": 136.87, "step": 7080, "token_acc": 0.5988420181968569, "train_speed(iter/s)": 0.224062 }, { "epoch": 2.7291987673343607, "grad_norm": 1.2097058296203613, "learning_rate": 2.764419547288545e-06, "loss": 1.7413345336914063, "memory(GiB)": 136.87, "step": 7085, "token_acc": 0.5783132530120482, "train_speed(iter/s)": 0.224147 }, { "epoch": 2.731124807395994, "grad_norm": 0.6221473813056946, "learning_rate": 2.725523528365234e-06, "loss": 1.7770225524902343, "memory(GiB)": 136.87, "step": 7090, "token_acc": 0.5984698214791726, "train_speed(iter/s)": 0.224231 }, { "epoch": 2.733050847457627, "grad_norm": 2.5160443782806396, "learning_rate": 2.6868969895532184e-06, "loss": 1.7015766143798827, "memory(GiB)": 136.87, "step": 7095, "token_acc": 0.5720672769853098, "train_speed(iter/s)": 0.224131 }, { "epoch": 2.7349768875192604, "grad_norm": 0.7201350927352905, "learning_rate": 2.6485401049917425e-06, "loss": 1.7392303466796875, "memory(GiB)": 136.87, "step": 7100, "token_acc": 0.5874356333676622, "train_speed(iter/s)": 0.224217 }, { "epoch": 2.7369029275808936, "grad_norm": 1.706094741821289, "learning_rate": 2.61045304760444e-06, "loss": 1.7409717559814453, "memory(GiB)": 136.87, "step": 7105, "token_acc": 0.5839363241678727, "train_speed(iter/s)": 0.22405 }, { "epoch": 2.738828967642527, "grad_norm": 1.1317148208618164, "learning_rate": 2.572635989098418e-06, "loss": 1.7004514694213868, "memory(GiB)": 136.87, "step": 7110, "token_acc": 0.6190573770491803, "train_speed(iter/s)": 0.224136 }, { "epoch": 2.74075500770416, "grad_norm": 0.7893500328063965, "learning_rate": 2.535089099963611e-06, "loss": 1.7729026794433593, "memory(GiB)": 136.87, "step": 7115, "token_acc": 0.5918638072076056, "train_speed(iter/s)": 0.224223 }, { "epoch": 2.7426810477657937, "grad_norm": 0.5801466703414917, "learning_rate": 2.4978125494719284e-06, "loss": 1.7224542617797851, "memory(GiB)": 136.87, "step": 7120, "token_acc": 0.5969348659003831, "train_speed(iter/s)": 0.224052 }, { "epoch": 2.744607087827427, "grad_norm": 0.7217654585838318, "learning_rate": 2.460806505676497e-06, "loss": 1.7981945037841798, "memory(GiB)": 136.87, "step": 7125, "token_acc": 0.6116018845700825, "train_speed(iter/s)": 0.224138 }, { "epoch": 2.74653312788906, "grad_norm": 1.0213717222213745, "learning_rate": 2.4240711354109603e-06, "loss": 1.7582998275756836, "memory(GiB)": 136.87, "step": 7130, "token_acc": 0.5914377629299679, "train_speed(iter/s)": 0.223996 }, { "epoch": 2.7484591679506933, "grad_norm": 2.3008954524993896, "learning_rate": 2.3876066042886752e-06, "loss": 1.7343677520751952, "memory(GiB)": 136.87, "step": 7135, "token_acc": 0.5983387718777811, "train_speed(iter/s)": 0.22408 }, { "epoch": 2.7503852080123266, "grad_norm": 0.7274791598320007, "learning_rate": 2.3514130767019888e-06, "loss": 1.6822286605834962, "memory(GiB)": 136.87, "step": 7140, "token_acc": 0.6042553191489362, "train_speed(iter/s)": 0.223894 }, { "epoch": 2.75231124807396, "grad_norm": 0.693932294845581, "learning_rate": 2.3154907158214682e-06, "loss": 1.6893333435058593, "memory(GiB)": 136.87, "step": 7145, "token_acc": 0.6180094786729858, "train_speed(iter/s)": 0.223981 }, { "epoch": 2.7542372881355934, "grad_norm": 1.459757924079895, "learning_rate": 2.279839683595186e-06, "loss": 1.700738525390625, "memory(GiB)": 136.87, "step": 7150, "token_acc": 0.5805562515660235, "train_speed(iter/s)": 0.224065 }, { "epoch": 2.7561633281972266, "grad_norm": 0.7023071050643921, "learning_rate": 2.244460140748014e-06, "loss": 1.755146598815918, "memory(GiB)": 136.87, "step": 7155, "token_acc": 0.5938357610301879, "train_speed(iter/s)": 0.223996 }, { "epoch": 2.75808936825886, "grad_norm": 0.7074206471443176, "learning_rate": 2.2093522467808434e-06, "loss": 1.7734880447387695, "memory(GiB)": 136.87, "step": 7160, "token_acc": 0.5752788104089219, "train_speed(iter/s)": 0.224081 }, { "epoch": 2.760015408320493, "grad_norm": 0.7820270657539368, "learning_rate": 2.1745161599699276e-06, "loss": 1.7644598007202148, "memory(GiB)": 136.87, "step": 7165, "token_acc": 0.5852287931495852, "train_speed(iter/s)": 0.223942 }, { "epoch": 2.7619414483821263, "grad_norm": 2.118448257446289, "learning_rate": 2.139952037366104e-06, "loss": 1.731546401977539, "memory(GiB)": 136.87, "step": 7170, "token_acc": 0.5904084442404773, "train_speed(iter/s)": 0.224025 }, { "epoch": 2.7638674884437595, "grad_norm": 0.6677964925765991, "learning_rate": 2.105660034794142e-06, "loss": 1.722255325317383, "memory(GiB)": 136.87, "step": 7175, "token_acc": 0.5678412312677197, "train_speed(iter/s)": 0.22411 }, { "epoch": 2.7657935285053927, "grad_norm": 0.6672474145889282, "learning_rate": 2.0716403068520157e-06, "loss": 1.7261585235595702, "memory(GiB)": 136.87, "step": 7180, "token_acc": 0.5885957900346389, "train_speed(iter/s)": 0.223918 }, { "epoch": 2.767719568567026, "grad_norm": 0.7895959615707397, "learning_rate": 2.0378930069101935e-06, "loss": 1.6999780654907226, "memory(GiB)": 136.87, "step": 7185, "token_acc": 0.5931575506646328, "train_speed(iter/s)": 0.224004 }, { "epoch": 2.7696456086286596, "grad_norm": 1.091092824935913, "learning_rate": 2.0044182871109886e-06, "loss": 1.7950153350830078, "memory(GiB)": 136.87, "step": 7190, "token_acc": 0.6006639791320845, "train_speed(iter/s)": 0.223937 }, { "epoch": 2.771571648690293, "grad_norm": 0.8204126358032227, "learning_rate": 1.9712162983678214e-06, "loss": 1.7184188842773438, "memory(GiB)": 136.87, "step": 7195, "token_acc": 0.6253071253071253, "train_speed(iter/s)": 0.224024 }, { "epoch": 2.773497688751926, "grad_norm": 0.8532833456993103, "learning_rate": 1.9382871903645613e-06, "loss": 1.6862924575805665, "memory(GiB)": 136.87, "step": 7200, "token_acc": 0.5926946933149552, "train_speed(iter/s)": 0.224023 }, { "epoch": 2.7754237288135593, "grad_norm": 0.8062304258346558, "learning_rate": 1.9056311115548812e-06, "loss": 1.7388378143310548, "memory(GiB)": 136.87, "step": 7205, "token_acc": 0.5803533866217921, "train_speed(iter/s)": 0.224105 }, { "epoch": 2.7773497688751925, "grad_norm": 0.7800110578536987, "learning_rate": 1.8732482091615364e-06, "loss": 1.7490245819091796, "memory(GiB)": 136.87, "step": 7210, "token_acc": 0.5981247274313127, "train_speed(iter/s)": 0.224188 }, { "epoch": 2.779275808936826, "grad_norm": 0.8984308242797852, "learning_rate": 1.8411386291757385e-06, "loss": 1.7406297683715821, "memory(GiB)": 136.87, "step": 7215, "token_acc": 0.6114086146682188, "train_speed(iter/s)": 0.224032 }, { "epoch": 2.7812018489984593, "grad_norm": 0.8017980456352234, "learning_rate": 1.809302516356498e-06, "loss": 1.713345718383789, "memory(GiB)": 136.87, "step": 7220, "token_acc": 0.6096557696471098, "train_speed(iter/s)": 0.224115 }, { "epoch": 2.7831278890600926, "grad_norm": 0.7595753073692322, "learning_rate": 1.7777400142299227e-06, "loss": 1.7871646881103516, "memory(GiB)": 136.87, "step": 7225, "token_acc": 0.6052894211576846, "train_speed(iter/s)": 0.224011 }, { "epoch": 2.785053929121726, "grad_norm": 1.0144189596176147, "learning_rate": 1.7464512650886486e-06, "loss": 1.783905601501465, "memory(GiB)": 136.87, "step": 7230, "token_acc": 0.6040133779264214, "train_speed(iter/s)": 0.224095 }, { "epoch": 2.786979969183359, "grad_norm": 0.6715564131736755, "learning_rate": 1.7154364099911183e-06, "loss": 1.7177024841308595, "memory(GiB)": 136.87, "step": 7235, "token_acc": 0.5976331360946746, "train_speed(iter/s)": 0.224181 }, { "epoch": 2.788906009244992, "grad_norm": 0.7995480895042419, "learning_rate": 1.6846955887610121e-06, "loss": 1.8080570220947265, "memory(GiB)": 136.87, "step": 7240, "token_acc": 0.6073979591836735, "train_speed(iter/s)": 0.224071 }, { "epoch": 2.7908320493066254, "grad_norm": 0.6984428763389587, "learning_rate": 1.6542289399865753e-06, "loss": 1.7685264587402343, "memory(GiB)": 136.87, "step": 7245, "token_acc": 0.6078061911170929, "train_speed(iter/s)": 0.224154 }, { "epoch": 2.7927580893682586, "grad_norm": 0.6516634225845337, "learning_rate": 1.62403660102e-06, "loss": 1.7532470703125, "memory(GiB)": 136.87, "step": 7250, "token_acc": 0.5797590361445784, "train_speed(iter/s)": 0.224032 }, { "epoch": 2.7946841294298923, "grad_norm": 0.7911311984062195, "learning_rate": 1.5941187079768286e-06, "loss": 1.6637577056884765, "memory(GiB)": 136.87, "step": 7255, "token_acc": 0.6240387354030191, "train_speed(iter/s)": 0.224115 }, { "epoch": 2.7966101694915255, "grad_norm": 0.7663461565971375, "learning_rate": 1.5644753957353152e-06, "loss": 1.7792110443115234, "memory(GiB)": 136.87, "step": 7260, "token_acc": 0.5795691452397498, "train_speed(iter/s)": 0.223977 }, { "epoch": 2.7985362095531587, "grad_norm": 0.7572333216667175, "learning_rate": 1.5351067979358299e-06, "loss": 1.7072301864624024, "memory(GiB)": 136.87, "step": 7265, "token_acc": 0.5872894333843798, "train_speed(iter/s)": 0.224061 }, { "epoch": 2.800462249614792, "grad_norm": 1.1427669525146484, "learning_rate": 1.5060130469802536e-06, "loss": 1.7319677352905274, "memory(GiB)": 136.87, "step": 7270, "token_acc": 0.6005447117566954, "train_speed(iter/s)": 0.224145 }, { "epoch": 2.802388289676425, "grad_norm": 0.7508957386016846, "learning_rate": 1.4771942740313752e-06, "loss": 1.7709579467773438, "memory(GiB)": 136.87, "step": 7275, "token_acc": 0.5928060066352366, "train_speed(iter/s)": 0.223962 }, { "epoch": 2.8043143297380584, "grad_norm": 1.0495327711105347, "learning_rate": 1.4486506090123155e-06, "loss": 1.7527055740356445, "memory(GiB)": 136.87, "step": 7280, "token_acc": 0.5883588989283463, "train_speed(iter/s)": 0.224046 }, { "epoch": 2.806240369799692, "grad_norm": 0.8350591063499451, "learning_rate": 1.420382180605917e-06, "loss": 1.7769176483154296, "memory(GiB)": 136.87, "step": 7285, "token_acc": 0.5955456570155901, "train_speed(iter/s)": 0.22392 }, { "epoch": 2.8081664098613253, "grad_norm": 1.2765564918518066, "learning_rate": 1.3923891162541947e-06, "loss": 1.752676773071289, "memory(GiB)": 136.87, "step": 7290, "token_acc": 0.5978445830969937, "train_speed(iter/s)": 0.224005 }, { "epoch": 2.8100924499229585, "grad_norm": 0.6112701892852783, "learning_rate": 1.3646715421577264e-06, "loss": 1.7212696075439453, "memory(GiB)": 136.87, "step": 7295, "token_acc": 0.5964912280701754, "train_speed(iter/s)": 0.224085 }, { "epoch": 2.8120184899845917, "grad_norm": 1.2070486545562744, "learning_rate": 1.337229583275118e-06, "loss": 1.7063007354736328, "memory(GiB)": 136.87, "step": 7300, "token_acc": 0.6025467353020861, "train_speed(iter/s)": 0.224016 }, { "epoch": 2.813944530046225, "grad_norm": 4.58001184463501, "learning_rate": 1.310063363322421e-06, "loss": 1.735680389404297, "memory(GiB)": 136.87, "step": 7305, "token_acc": 0.650390625, "train_speed(iter/s)": 0.224101 }, { "epoch": 2.815870570107858, "grad_norm": 0.7477810382843018, "learning_rate": 1.2831730047725698e-06, "loss": 1.7414691925048829, "memory(GiB)": 136.87, "step": 7310, "token_acc": 0.6044548651817117, "train_speed(iter/s)": 0.223964 }, { "epoch": 2.8177966101694913, "grad_norm": 1.0230112075805664, "learning_rate": 1.2565586288548619e-06, "loss": 1.779718780517578, "memory(GiB)": 136.87, "step": 7315, "token_acc": 0.6110091743119266, "train_speed(iter/s)": 0.224047 }, { "epoch": 2.8197226502311246, "grad_norm": 1.0534124374389648, "learning_rate": 1.230220355554361e-06, "loss": 1.7339641571044921, "memory(GiB)": 136.87, "step": 7320, "token_acc": 0.6074277168494516, "train_speed(iter/s)": 0.223899 }, { "epoch": 2.821648690292758, "grad_norm": 2.2908058166503906, "learning_rate": 1.2041583036113897e-06, "loss": 1.7959096908569336, "memory(GiB)": 136.87, "step": 7325, "token_acc": 0.5788557213930349, "train_speed(iter/s)": 0.223982 }, { "epoch": 2.8235747303543914, "grad_norm": 0.6651281714439392, "learning_rate": 1.1783725905210042e-06, "loss": 1.6699861526489257, "memory(GiB)": 136.87, "step": 7330, "token_acc": 0.6325929890286326, "train_speed(iter/s)": 0.224063 }, { "epoch": 2.8255007704160247, "grad_norm": 0.7531706094741821, "learning_rate": 1.1528633325324152e-06, "loss": 1.7188030242919923, "memory(GiB)": 136.87, "step": 7335, "token_acc": 0.5931999035447312, "train_speed(iter/s)": 0.22398 }, { "epoch": 2.827426810477658, "grad_norm": 0.798428475856781, "learning_rate": 1.1276306446485265e-06, "loss": 1.7642208099365235, "memory(GiB)": 136.87, "step": 7340, "token_acc": 0.6088407005838199, "train_speed(iter/s)": 0.224064 }, { "epoch": 2.829352850539291, "grad_norm": 1.0747370719909668, "learning_rate": 1.10267464062537e-06, "loss": 1.7407045364379883, "memory(GiB)": 136.87, "step": 7345, "token_acc": 0.5861627162075592, "train_speed(iter/s)": 0.223902 }, { "epoch": 2.8312788906009247, "grad_norm": 2.9889800548553467, "learning_rate": 1.0779954329716152e-06, "loss": 1.7443748474121095, "memory(GiB)": 136.87, "step": 7350, "token_acc": 0.6030581039755352, "train_speed(iter/s)": 0.223984 }, { "epoch": 2.833204930662558, "grad_norm": 0.8766227960586548, "learning_rate": 1.0535931329480607e-06, "loss": 1.7859058380126953, "memory(GiB)": 136.87, "step": 7355, "token_acc": 0.601958814665997, "train_speed(iter/s)": 0.224069 }, { "epoch": 2.835130970724191, "grad_norm": 1.2737691402435303, "learning_rate": 1.029467850567116e-06, "loss": 1.7284679412841797, "memory(GiB)": 136.87, "step": 7360, "token_acc": 0.6073603388933015, "train_speed(iter/s)": 0.224009 }, { "epoch": 2.8370570107858244, "grad_norm": 1.1878881454467773, "learning_rate": 1.0056196945923204e-06, "loss": 1.7716400146484375, "memory(GiB)": 136.87, "step": 7365, "token_acc": 0.5788759163725224, "train_speed(iter/s)": 0.224092 }, { "epoch": 2.8389830508474576, "grad_norm": 0.6760169863700867, "learning_rate": 9.820487725378593e-07, "loss": 1.7549810409545898, "memory(GiB)": 136.87, "step": 7370, "token_acc": 0.6170703575547867, "train_speed(iter/s)": 0.223916 }, { "epoch": 2.840909090909091, "grad_norm": 0.6346534490585327, "learning_rate": 9.587551906680565e-07, "loss": 1.776894760131836, "memory(GiB)": 136.87, "step": 7375, "token_acc": 0.5744502617801047, "train_speed(iter/s)": 0.223997 }, { "epoch": 2.842835130970724, "grad_norm": 0.713191568851471, "learning_rate": 9.35739053996916e-07, "loss": 1.745503044128418, "memory(GiB)": 136.87, "step": 7380, "token_acc": 0.5749802683504341, "train_speed(iter/s)": 0.223922 }, { "epoch": 2.8447611710323573, "grad_norm": 0.890779435634613, "learning_rate": 9.130004662876445e-07, "loss": 1.7477146148681642, "memory(GiB)": 136.87, "step": 7385, "token_acc": 0.6170944087992667, "train_speed(iter/s)": 0.224005 }, { "epoch": 2.846687211093991, "grad_norm": 0.5629829168319702, "learning_rate": 8.905395300521715e-07, "loss": 1.6916961669921875, "memory(GiB)": 136.87, "step": 7390, "token_acc": 0.6348804500703235, "train_speed(iter/s)": 0.224088 }, { "epoch": 2.848613251155624, "grad_norm": 2.1078343391418457, "learning_rate": 8.683563465506985e-07, "loss": 1.7859531402587892, "memory(GiB)": 136.87, "step": 7395, "token_acc": 0.5821123988628909, "train_speed(iter/s)": 0.223972 }, { "epoch": 2.8505392912172574, "grad_norm": 0.7170923352241516, "learning_rate": 8.464510157912414e-07, "loss": 1.7205808639526368, "memory(GiB)": 136.87, "step": 7400, "token_acc": 0.5926935659760088, "train_speed(iter/s)": 0.224053 }, { "epoch": 2.8524653312788906, "grad_norm": 3.9417965412139893, "learning_rate": 8.248236365291858e-07, "loss": 1.753695297241211, "memory(GiB)": 136.87, "step": 7405, "token_acc": 0.5918211836423672, "train_speed(iter/s)": 0.223883 }, { "epoch": 2.854391371340524, "grad_norm": 2.6885786056518555, "learning_rate": 8.03474306266816e-07, "loss": 1.7665067672729493, "memory(GiB)": 136.87, "step": 7410, "token_acc": 0.5976744186046512, "train_speed(iter/s)": 0.223965 }, { "epoch": 2.856317411402157, "grad_norm": 1.2264795303344727, "learning_rate": 7.824031212528976e-07, "loss": 1.7701858520507812, "memory(GiB)": 136.87, "step": 7415, "token_acc": 0.598019801980198, "train_speed(iter/s)": 0.224049 }, { "epoch": 2.8582434514637907, "grad_norm": 0.7309343814849854, "learning_rate": 7.616101764822622e-07, "loss": 1.7650527954101562, "memory(GiB)": 136.87, "step": 7420, "token_acc": 0.6160493827160494, "train_speed(iter/s)": 0.22392 }, { "epoch": 2.860169491525424, "grad_norm": 1.17842698097229, "learning_rate": 7.410955656953211e-07, "loss": 1.7374954223632812, "memory(GiB)": 136.87, "step": 7425, "token_acc": 0.5829340634268766, "train_speed(iter/s)": 0.224 }, { "epoch": 2.862095531587057, "grad_norm": 0.91789710521698, "learning_rate": 7.208593813777045e-07, "loss": 1.669989776611328, "memory(GiB)": 136.87, "step": 7430, "token_acc": 0.6055923473142016, "train_speed(iter/s)": 0.223858 }, { "epoch": 2.8640215716486903, "grad_norm": 3.0838663578033447, "learning_rate": 7.009017147598107e-07, "loss": 1.762928581237793, "memory(GiB)": 136.87, "step": 7435, "token_acc": 0.6019141231246766, "train_speed(iter/s)": 0.22394 }, { "epoch": 2.8659476117103235, "grad_norm": 0.8343214392662048, "learning_rate": 6.812226558163895e-07, "loss": 1.762009048461914, "memory(GiB)": 136.87, "step": 7440, "token_acc": 0.6040313549832027, "train_speed(iter/s)": 0.223836 }, { "epoch": 2.8678736517719567, "grad_norm": 1.6233747005462646, "learning_rate": 6.618222932661816e-07, "loss": 1.722498321533203, "memory(GiB)": 136.87, "step": 7445, "token_acc": 0.6003214572729708, "train_speed(iter/s)": 0.223918 }, { "epoch": 2.86979969183359, "grad_norm": 1.231989860534668, "learning_rate": 6.427007145714397e-07, "loss": 1.7752113342285156, "memory(GiB)": 136.87, "step": 7450, "token_acc": 0.5910866069377441, "train_speed(iter/s)": 0.224 }, { "epoch": 2.871725731895223, "grad_norm": 0.7094095349311829, "learning_rate": 6.238580059376303e-07, "loss": 1.7449148178100586, "memory(GiB)": 136.87, "step": 7455, "token_acc": 0.5900690269427744, "train_speed(iter/s)": 0.223867 }, { "epoch": 2.873651771956857, "grad_norm": 0.6649959087371826, "learning_rate": 6.052942523129476e-07, "loss": 1.7557939529418944, "memory(GiB)": 136.87, "step": 7460, "token_acc": 0.6021354313009273, "train_speed(iter/s)": 0.223948 }, { "epoch": 2.87557781201849, "grad_norm": 0.8477678298950195, "learning_rate": 5.870095373880154e-07, "loss": 1.7571399688720704, "memory(GiB)": 136.87, "step": 7465, "token_acc": 0.6047463175122749, "train_speed(iter/s)": 0.223831 }, { "epoch": 2.8775038520801233, "grad_norm": 0.7108432054519653, "learning_rate": 5.690039435954572e-07, "loss": 1.7514724731445312, "memory(GiB)": 136.87, "step": 7470, "token_acc": 0.6071428571428571, "train_speed(iter/s)": 0.223889 }, { "epoch": 2.8794298921417565, "grad_norm": 0.6702368855476379, "learning_rate": 5.512775521095345e-07, "loss": 1.7339820861816406, "memory(GiB)": 136.87, "step": 7475, "token_acc": 0.5834730538922156, "train_speed(iter/s)": 0.223973 }, { "epoch": 2.8813559322033897, "grad_norm": 1.0539880990982056, "learning_rate": 5.338304428458007e-07, "loss": 1.7741287231445313, "memory(GiB)": 136.87, "step": 7480, "token_acc": 0.5868980689318015, "train_speed(iter/s)": 0.223909 }, { "epoch": 2.8832819722650234, "grad_norm": 0.7403910160064697, "learning_rate": 5.166626944607192e-07, "loss": 1.770228385925293, "memory(GiB)": 136.87, "step": 7485, "token_acc": 0.5823454699407282, "train_speed(iter/s)": 0.223948 }, { "epoch": 2.8852080123266566, "grad_norm": 0.7450537085533142, "learning_rate": 4.997743843513161e-07, "loss": 1.7288265228271484, "memory(GiB)": 136.87, "step": 7490, "token_acc": 0.5866099893730075, "train_speed(iter/s)": 0.223923 }, { "epoch": 2.88713405238829, "grad_norm": 0.5840745568275452, "learning_rate": 4.831655886548339e-07, "loss": 1.7547086715698241, "memory(GiB)": 136.87, "step": 7495, "token_acc": 0.5642095503013445, "train_speed(iter/s)": 0.223907 }, { "epoch": 2.889060092449923, "grad_norm": 1.1622965335845947, "learning_rate": 4.6683638224837703e-07, "loss": 1.7875503540039062, "memory(GiB)": 136.87, "step": 7500, "token_acc": 0.5763123784834737, "train_speed(iter/s)": 0.223941 }, { "epoch": 2.8909861325115562, "grad_norm": 0.5760577917098999, "learning_rate": 4.5078683874859305e-07, "loss": 1.7808916091918945, "memory(GiB)": 136.87, "step": 7505, "token_acc": 0.5878914405010438, "train_speed(iter/s)": 0.224021 }, { "epoch": 2.8929121725731894, "grad_norm": 0.8660067319869995, "learning_rate": 4.350170305113255e-07, "loss": 1.6699819564819336, "memory(GiB)": 136.87, "step": 7510, "token_acc": 0.5953842376626565, "train_speed(iter/s)": 0.223962 }, { "epoch": 2.8948382126348227, "grad_norm": 0.8191347122192383, "learning_rate": 4.195270286313016e-07, "loss": 1.779383659362793, "memory(GiB)": 136.87, "step": 7515, "token_acc": 0.5765782592454239, "train_speed(iter/s)": 0.22397 }, { "epoch": 2.896764252696456, "grad_norm": 0.9169038534164429, "learning_rate": 4.043169029417926e-07, "loss": 1.7842195510864258, "memory(GiB)": 136.87, "step": 7520, "token_acc": 0.5828894806924101, "train_speed(iter/s)": 0.223963 }, { "epoch": 2.898690292758089, "grad_norm": 0.6430149674415588, "learning_rate": 3.8938672201430103e-07, "loss": 1.7427606582641602, "memory(GiB)": 136.87, "step": 7525, "token_acc": 0.5958868894601542, "train_speed(iter/s)": 0.223934 }, { "epoch": 2.9006163328197228, "grad_norm": 0.9263331294059753, "learning_rate": 3.747365531582905e-07, "loss": 1.7288997650146485, "memory(GiB)": 136.87, "step": 7530, "token_acc": 0.5921279212792128, "train_speed(iter/s)": 0.223882 }, { "epoch": 2.902542372881356, "grad_norm": 0.5870047211647034, "learning_rate": 3.6036646242082473e-07, "loss": 1.735024642944336, "memory(GiB)": 136.87, "step": 7535, "token_acc": 0.5928615895413987, "train_speed(iter/s)": 0.223963 }, { "epoch": 2.904468412942989, "grad_norm": 0.7504586577415466, "learning_rate": 3.4627651458629673e-07, "loss": 1.7281782150268554, "memory(GiB)": 136.87, "step": 7540, "token_acc": 0.6100418410041841, "train_speed(iter/s)": 0.223937 }, { "epoch": 2.9063944530046224, "grad_norm": 0.7671431303024292, "learning_rate": 3.324667731761585e-07, "loss": 1.700419044494629, "memory(GiB)": 136.87, "step": 7545, "token_acc": 0.630580682812956, "train_speed(iter/s)": 0.223964 }, { "epoch": 2.9083204930662556, "grad_norm": 0.6485986709594727, "learning_rate": 3.1893730044858793e-07, "loss": 1.7233165740966796, "memory(GiB)": 136.87, "step": 7550, "token_acc": 0.6069044879171461, "train_speed(iter/s)": 0.223879 }, { "epoch": 2.9102465331278893, "grad_norm": 1.8354309797286987, "learning_rate": 3.0568815739825257e-07, "loss": 1.8245319366455077, "memory(GiB)": 136.87, "step": 7555, "token_acc": 0.5828267477203647, "train_speed(iter/s)": 0.223958 }, { "epoch": 2.9121725731895225, "grad_norm": 1.4922711849212646, "learning_rate": 2.927194037559977e-07, "loss": 1.734865951538086, "memory(GiB)": 136.87, "step": 7560, "token_acc": 0.5981385162879824, "train_speed(iter/s)": 0.223795 }, { "epoch": 2.9140986132511557, "grad_norm": 0.8372921347618103, "learning_rate": 2.8003109798861033e-07, "loss": 1.674810791015625, "memory(GiB)": 136.87, "step": 7565, "token_acc": 0.6110693713999499, "train_speed(iter/s)": 0.223876 }, { "epoch": 2.916024653312789, "grad_norm": 0.802435040473938, "learning_rate": 2.676232972985346e-07, "loss": 1.730869674682617, "memory(GiB)": 136.87, "step": 7570, "token_acc": 0.6064052678838671, "train_speed(iter/s)": 0.223956 }, { "epoch": 2.917950693374422, "grad_norm": 0.6881040334701538, "learning_rate": 2.554960576236082e-07, "loss": 1.7926429748535155, "memory(GiB)": 136.87, "step": 7575, "token_acc": 0.6115107913669064, "train_speed(iter/s)": 0.223795 }, { "epoch": 2.9198767334360554, "grad_norm": 0.6949822902679443, "learning_rate": 2.436494336368403e-07, "loss": 1.7326370239257813, "memory(GiB)": 136.87, "step": 7580, "token_acc": 0.5845997973657548, "train_speed(iter/s)": 0.223877 }, { "epoch": 2.9218027734976886, "grad_norm": 0.7776098251342773, "learning_rate": 2.3208347874612706e-07, "loss": 1.7021476745605468, "memory(GiB)": 136.87, "step": 7585, "token_acc": 0.6014399588583184, "train_speed(iter/s)": 0.2238 }, { "epoch": 2.923728813559322, "grad_norm": 0.8195444941520691, "learning_rate": 2.207982450940435e-07, "loss": 1.7387762069702148, "memory(GiB)": 136.87, "step": 7590, "token_acc": 0.6017857142857143, "train_speed(iter/s)": 0.223882 }, { "epoch": 2.9256548536209555, "grad_norm": 2.540602445602417, "learning_rate": 2.0979378355758666e-07, "loss": 1.7658845901489257, "memory(GiB)": 136.87, "step": 7595, "token_acc": 0.5994152046783626, "train_speed(iter/s)": 0.223964 }, { "epoch": 2.9275808936825887, "grad_norm": 0.7009822130203247, "learning_rate": 1.9907014374796057e-07, "loss": 1.7436330795288086, "memory(GiB)": 136.87, "step": 7600, "token_acc": 0.571943887775551, "train_speed(iter/s)": 0.22387 }, { "epoch": 2.929506933744222, "grad_norm": 0.5691471695899963, "learning_rate": 1.886273740103403e-07, "loss": 1.7309642791748048, "memory(GiB)": 136.87, "step": 7605, "token_acc": 0.5800542740841248, "train_speed(iter/s)": 0.223899 }, { "epoch": 2.931432973805855, "grad_norm": 1.1609901189804077, "learning_rate": 1.7846552142366385e-07, "loss": 1.7344337463378907, "memory(GiB)": 136.87, "step": 7610, "token_acc": 0.5763970300898789, "train_speed(iter/s)": 0.223777 }, { "epoch": 2.9333590138674883, "grad_norm": 0.7125633955001831, "learning_rate": 1.6858463180040308e-07, "loss": 1.779339599609375, "memory(GiB)": 136.87, "step": 7615, "token_acc": 0.6075451925596018, "train_speed(iter/s)": 0.223759 }, { "epoch": 2.935285053929122, "grad_norm": 0.6668746471405029, "learning_rate": 1.589847496863972e-07, "loss": 1.740182113647461, "memory(GiB)": 136.87, "step": 7620, "token_acc": 0.5951795376291196, "train_speed(iter/s)": 0.22363 }, { "epoch": 2.937211093990755, "grad_norm": 1.28075110912323, "learning_rate": 1.4966591836060305e-07, "loss": 1.7689586639404298, "memory(GiB)": 136.87, "step": 7625, "token_acc": 0.6207694532831936, "train_speed(iter/s)": 0.22371 }, { "epoch": 2.9391371340523884, "grad_norm": 1.0082805156707764, "learning_rate": 1.406281798349146e-07, "loss": 1.7024627685546876, "memory(GiB)": 136.87, "step": 7630, "token_acc": 0.6028976936723832, "train_speed(iter/s)": 0.223733 }, { "epoch": 2.9410631741140216, "grad_norm": 1.7123711109161377, "learning_rate": 1.318715748540103e-07, "loss": 1.739908218383789, "memory(GiB)": 136.87, "step": 7635, "token_acc": 0.5926148303812668, "train_speed(iter/s)": 0.223633 }, { "epoch": 2.942989214175655, "grad_norm": 1.2881314754486084, "learning_rate": 1.2339614289511026e-07, "loss": 1.681553268432617, "memory(GiB)": 136.87, "step": 7640, "token_acc": 0.6093630084420568, "train_speed(iter/s)": 0.223709 }, { "epoch": 2.944915254237288, "grad_norm": 0.6485515832901001, "learning_rate": 1.1520192216784437e-07, "loss": 1.8039119720458985, "memory(GiB)": 136.87, "step": 7645, "token_acc": 0.5826385483079941, "train_speed(iter/s)": 0.223597 }, { "epoch": 2.9468412942989213, "grad_norm": 1.1322157382965088, "learning_rate": 1.0728894961405805e-07, "loss": 1.736688232421875, "memory(GiB)": 136.87, "step": 7650, "token_acc": 0.6032078103207811, "train_speed(iter/s)": 0.223675 }, { "epoch": 2.9487673343605545, "grad_norm": 2.102384090423584, "learning_rate": 9.965726090765264e-08, "loss": 1.728193473815918, "memory(GiB)": 136.87, "step": 7655, "token_acc": 0.5759125784701232, "train_speed(iter/s)": 0.223754 }, { "epoch": 2.9506933744221877, "grad_norm": 0.768444299697876, "learning_rate": 9.230689045441887e-08, "loss": 1.7391998291015625, "memory(GiB)": 136.87, "step": 7660, "token_acc": 0.599123234291281, "train_speed(iter/s)": 0.223609 }, { "epoch": 2.9526194144838214, "grad_norm": 1.381227731704712, "learning_rate": 8.523787139189804e-08, "loss": 1.6870954513549805, "memory(GiB)": 136.87, "step": 7665, "token_acc": 0.587160751565762, "train_speed(iter/s)": 0.223686 }, { "epoch": 2.9545454545454546, "grad_norm": 0.7364832758903503, "learning_rate": 7.845023558920167e-08, "loss": 1.7425212860107422, "memory(GiB)": 136.87, "step": 7670, "token_acc": 0.627431906614786, "train_speed(iter/s)": 0.223552 }, { "epoch": 2.956471494607088, "grad_norm": 0.6661244630813599, "learning_rate": 7.194401364690046e-08, "loss": 1.713069534301758, "memory(GiB)": 136.87, "step": 7675, "token_acc": 0.6015793251974156, "train_speed(iter/s)": 0.223633 }, { "epoch": 2.958397534668721, "grad_norm": 0.9731634259223938, "learning_rate": 6.571923489686466e-08, "loss": 1.7423614501953124, "memory(GiB)": 136.87, "step": 7680, "token_acc": 0.5785871964679912, "train_speed(iter/s)": 0.223555 }, { "epoch": 2.9603235747303542, "grad_norm": 1.269974708557129, "learning_rate": 5.977592740214616e-08, "loss": 1.7837532043457032, "memory(GiB)": 136.87, "step": 7685, "token_acc": 0.6003172085646312, "train_speed(iter/s)": 0.223633 }, { "epoch": 2.962249614791988, "grad_norm": 0.7876796126365662, "learning_rate": 5.411411795684662e-08, "loss": 1.7362480163574219, "memory(GiB)": 136.87, "step": 7690, "token_acc": 0.5980608197443807, "train_speed(iter/s)": 0.223713 }, { "epoch": 2.964175654853621, "grad_norm": 1.410186529159546, "learning_rate": 4.873383208599258e-08, "loss": 1.7545875549316405, "memory(GiB)": 136.87, "step": 7695, "token_acc": 0.5949971894322653, "train_speed(iter/s)": 0.223726 }, { "epoch": 2.9661016949152543, "grad_norm": 0.6813892722129822, "learning_rate": 4.363509404541055e-08, "loss": 1.733758544921875, "memory(GiB)": 136.87, "step": 7700, "token_acc": 0.6202933985330074, "train_speed(iter/s)": 0.22378 }, { "epoch": 2.9680277349768875, "grad_norm": 0.7678742408752441, "learning_rate": 3.88179268216507e-08, "loss": 1.7275629043579102, "memory(GiB)": 136.87, "step": 7705, "token_acc": 0.6020005264543301, "train_speed(iter/s)": 0.223854 }, { "epoch": 2.9699537750385208, "grad_norm": 0.8488406538963318, "learning_rate": 3.428235213185499e-08, "loss": 1.7188274383544921, "memory(GiB)": 136.87, "step": 7710, "token_acc": 0.6415284062342886, "train_speed(iter/s)": 0.223895 }, { "epoch": 2.971879815100154, "grad_norm": 0.6815594434738159, "learning_rate": 3.002839042366701e-08, "loss": 1.72490234375, "memory(GiB)": 136.87, "step": 7715, "token_acc": 0.5885198323121573, "train_speed(iter/s)": 0.223973 }, { "epoch": 2.973805855161787, "grad_norm": 0.7621335387229919, "learning_rate": 2.6056060875134792e-08, "loss": 1.7608932495117187, "memory(GiB)": 136.87, "step": 7720, "token_acc": 0.6017306412247615, "train_speed(iter/s)": 0.224053 }, { "epoch": 2.9757318952234204, "grad_norm": 0.8194906711578369, "learning_rate": 2.236538139464145e-08, "loss": 1.7605945587158203, "memory(GiB)": 136.87, "step": 7725, "token_acc": 0.5853899308983218, "train_speed(iter/s)": 0.224108 }, { "epoch": 2.977657935285054, "grad_norm": 0.9346332550048828, "learning_rate": 1.895636862079414e-08, "loss": 1.7496177673339843, "memory(GiB)": 136.87, "step": 7730, "token_acc": 0.6057591623036649, "train_speed(iter/s)": 0.224188 }, { "epoch": 2.9795839753466873, "grad_norm": 0.7730504274368286, "learning_rate": 1.5829037922396315e-08, "loss": 1.7678319931030273, "memory(GiB)": 136.87, "step": 7735, "token_acc": 0.5696400625978091, "train_speed(iter/s)": 0.224267 }, { "epoch": 2.9815100154083205, "grad_norm": 0.9626866579055786, "learning_rate": 1.2983403398315886e-08, "loss": 1.7446685791015626, "memory(GiB)": 136.87, "step": 7740, "token_acc": 0.5857822558074447, "train_speed(iter/s)": 0.224345 }, { "epoch": 2.9834360554699537, "grad_norm": 1.6828466653823853, "learning_rate": 1.0419477877478266e-08, "loss": 1.8140941619873048, "memory(GiB)": 136.87, "step": 7745, "token_acc": 0.5731184988782378, "train_speed(iter/s)": 0.224424 }, { "epoch": 2.985362095531587, "grad_norm": 0.8332844972610474, "learning_rate": 8.137272918776196e-09, "loss": 1.807952880859375, "memory(GiB)": 136.87, "step": 7750, "token_acc": 0.6261818181818182, "train_speed(iter/s)": 0.224503 }, { "epoch": 2.9872881355932206, "grad_norm": 0.6141830086708069, "learning_rate": 6.136798811041955e-09, "loss": 1.7859077453613281, "memory(GiB)": 136.87, "step": 7755, "token_acc": 0.5931198102016607, "train_speed(iter/s)": 0.224583 }, { "epoch": 2.989214175654854, "grad_norm": 0.8151652812957764, "learning_rate": 4.418064572957181e-09, "loss": 1.7269287109375, "memory(GiB)": 136.87, "step": 7760, "token_acc": 0.5939366100137804, "train_speed(iter/s)": 0.224661 }, { "epoch": 2.991140215716487, "grad_norm": 0.693816602230072, "learning_rate": 2.9810779530667353e-09, "loss": 1.7516136169433594, "memory(GiB)": 136.87, "step": 7765, "token_acc": 0.5667808219178082, "train_speed(iter/s)": 0.22474 }, { "epoch": 2.9930662557781202, "grad_norm": 0.689964771270752, "learning_rate": 1.8258454297093163e-09, "loss": 1.7669166564941405, "memory(GiB)": 136.87, "step": 7770, "token_acc": 0.5735856653915845, "train_speed(iter/s)": 0.224819 }, { "epoch": 2.9949922958397535, "grad_norm": 2.221112012863159, "learning_rate": 9.523722109966437e-10, "loss": 1.7413850784301759, "memory(GiB)": 136.87, "step": 7775, "token_acc": 0.5852379953868736, "train_speed(iter/s)": 0.224898 }, { "epoch": 2.9969183359013867, "grad_norm": 0.7585455775260925, "learning_rate": 3.606622347926414e-10, "loss": 1.786970329284668, "memory(GiB)": 136.87, "step": 7780, "token_acc": 0.5913669064748202, "train_speed(iter/s)": 0.224974 }, { "epoch": 2.99884437596302, "grad_norm": 0.762778639793396, "learning_rate": 5.0718168685681684e-11, "loss": 1.7376707077026368, "memory(GiB)": 136.87, "step": 7785, "token_acc": 0.5744859420898027, "train_speed(iter/s)": 0.225053 } ], "logging_steps": 5, "max_steps": 7788, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 2000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 7.081820555673862e+18, "train_batch_size": 4, "trial_name": null, "trial_params": null }