Photon-S1 / trainer_state.json
chengyuff's picture
Upload folder using huggingface_hub
b7c1c87 verified
Raw
History Blame Contribute Delete
456 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 3.0,
"eval_steps": 500,
"global_step": 7788,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.0003852080123266564,
"grad_norm": 0.46284204721450806,
"learning_rate": 3.205128205128205e-07,
"loss": 2.371025800704956,
"memory(GiB)": 21.78,
"step": 1,
"token_acc": 0.491588785046729,
"train_speed(iter/s)": 0.013938
},
{
"epoch": 0.001926040061633282,
"grad_norm": 0.4700106978416443,
"learning_rate": 1.6025641025641025e-06,
"loss": 2.203892469406128,
"memory(GiB)": 32.84,
"step": 5,
"token_acc": 0.5115570231140463,
"train_speed(iter/s)": 0.062423
},
{
"epoch": 0.003852080123266564,
"grad_norm": 0.26454979181289673,
"learning_rate": 3.205128205128205e-06,
"loss": 2.249034881591797,
"memory(GiB)": 32.84,
"step": 10,
"token_acc": 0.5221336266153423,
"train_speed(iter/s)": 0.110437
},
{
"epoch": 0.005778120184899846,
"grad_norm": 0.3950284719467163,
"learning_rate": 4.807692307692308e-06,
"loss": 2.3276697158813477,
"memory(GiB)": 32.84,
"step": 15,
"token_acc": 0.5241591662719091,
"train_speed(iter/s)": 0.112702
},
{
"epoch": 0.007704160246533128,
"grad_norm": 0.5159429907798767,
"learning_rate": 6.41025641025641e-06,
"loss": 2.2817378997802735,
"memory(GiB)": 32.84,
"step": 20,
"token_acc": 0.5184376516254245,
"train_speed(iter/s)": 0.139372
},
{
"epoch": 0.00963020030816641,
"grad_norm": 0.5963405966758728,
"learning_rate": 8.012820512820513e-06,
"loss": 2.241648864746094,
"memory(GiB)": 32.84,
"step": 25,
"token_acc": 0.5197465681098205,
"train_speed(iter/s)": 0.136939
},
{
"epoch": 0.011556240369799691,
"grad_norm": 0.3511025607585907,
"learning_rate": 9.615384615384616e-06,
"loss": 2.2971473693847657,
"memory(GiB)": 32.84,
"step": 30,
"token_acc": 0.5320556696326717,
"train_speed(iter/s)": 0.155595
},
{
"epoch": 0.013482280431432974,
"grad_norm": 0.35379791259765625,
"learning_rate": 1.1217948717948719e-05,
"loss": 2.234834671020508,
"memory(GiB)": 32.84,
"step": 35,
"token_acc": 0.5269398793426253,
"train_speed(iter/s)": 0.17233
},
{
"epoch": 0.015408320493066256,
"grad_norm": 0.8552426695823669,
"learning_rate": 1.282051282051282e-05,
"loss": 2.2682783126831056,
"memory(GiB)": 32.84,
"step": 40,
"token_acc": 0.5272496831432193,
"train_speed(iter/s)": 0.164448
},
{
"epoch": 0.017334360554699536,
"grad_norm": 0.5381829142570496,
"learning_rate": 1.4423076923076924e-05,
"loss": 2.3280288696289064,
"memory(GiB)": 44.17,
"step": 45,
"token_acc": 0.5237177943655189,
"train_speed(iter/s)": 0.177578
},
{
"epoch": 0.01926040061633282,
"grad_norm": 0.8369658589363098,
"learning_rate": 1.6025641025641026e-05,
"loss": 2.3114912033081056,
"memory(GiB)": 44.17,
"step": 50,
"token_acc": 0.5134586084306755,
"train_speed(iter/s)": 0.168711
},
{
"epoch": 0.0211864406779661,
"grad_norm": 0.760637104511261,
"learning_rate": 1.7628205128205127e-05,
"loss": 2.27093563079834,
"memory(GiB)": 44.17,
"step": 55,
"token_acc": 0.5235980011104941,
"train_speed(iter/s)": 0.179294
},
{
"epoch": 0.023112480739599383,
"grad_norm": 0.6387038826942444,
"learning_rate": 1.923076923076923e-05,
"loss": 2.2536460876464846,
"memory(GiB)": 44.17,
"step": 60,
"token_acc": 0.5071521456436932,
"train_speed(iter/s)": 0.18911
},
{
"epoch": 0.025038520801232665,
"grad_norm": 0.5492486953735352,
"learning_rate": 2.0833333333333333e-05,
"loss": 2.266803741455078,
"memory(GiB)": 44.17,
"step": 65,
"token_acc": 0.5215773809523809,
"train_speed(iter/s)": 0.179833
},
{
"epoch": 0.026964560862865947,
"grad_norm": 1.2633668184280396,
"learning_rate": 2.2435897435897437e-05,
"loss": 2.301316833496094,
"memory(GiB)": 44.17,
"step": 70,
"token_acc": 0.5262734584450403,
"train_speed(iter/s)": 0.188206
},
{
"epoch": 0.02889060092449923,
"grad_norm": 0.683751106262207,
"learning_rate": 2.4038461538461542e-05,
"loss": 2.3863033294677733,
"memory(GiB)": 44.17,
"step": 75,
"token_acc": 0.5030753459764223,
"train_speed(iter/s)": 0.185858
},
{
"epoch": 0.030816640986132512,
"grad_norm": 0.773225724697113,
"learning_rate": 2.564102564102564e-05,
"loss": 2.2031593322753906,
"memory(GiB)": 44.17,
"step": 80,
"token_acc": 0.5095634095634095,
"train_speed(iter/s)": 0.193291
},
{
"epoch": 0.032742681047765794,
"grad_norm": 0.5375910997390747,
"learning_rate": 2.7243589743589744e-05,
"loss": 2.2097171783447265,
"memory(GiB)": 44.17,
"step": 85,
"token_acc": 0.5262407979102351,
"train_speed(iter/s)": 0.186851
},
{
"epoch": 0.03466872110939907,
"grad_norm": 1.0454059839248657,
"learning_rate": 2.884615384615385e-05,
"loss": 2.2334365844726562,
"memory(GiB)": 55.69,
"step": 90,
"token_acc": 0.5370946246112839,
"train_speed(iter/s)": 0.192933
},
{
"epoch": 0.03659476117103236,
"grad_norm": 0.6984673738479614,
"learning_rate": 3.044871794871795e-05,
"loss": 2.24798469543457,
"memory(GiB)": 55.69,
"step": 95,
"token_acc": 0.532988675529296,
"train_speed(iter/s)": 0.19931
},
{
"epoch": 0.03852080123266564,
"grad_norm": 0.7222554683685303,
"learning_rate": 3.205128205128205e-05,
"loss": 2.349885177612305,
"memory(GiB)": 55.69,
"step": 100,
"token_acc": 0.517610710607621,
"train_speed(iter/s)": 0.19213
},
{
"epoch": 0.04044684129429892,
"grad_norm": 0.7792360782623291,
"learning_rate": 3.365384615384615e-05,
"loss": 2.2670169830322267,
"memory(GiB)": 55.69,
"step": 105,
"token_acc": 0.510149682181669,
"train_speed(iter/s)": 0.197355
},
{
"epoch": 0.0423728813559322,
"grad_norm": 0.830783486366272,
"learning_rate": 3.5256410256410254e-05,
"loss": 2.2617393493652345,
"memory(GiB)": 55.69,
"step": 110,
"token_acc": 0.5031599416626155,
"train_speed(iter/s)": 0.19184
},
{
"epoch": 0.04429892141756549,
"grad_norm": 0.7352855205535889,
"learning_rate": 3.685897435897436e-05,
"loss": 2.1957550048828125,
"memory(GiB)": 55.69,
"step": 115,
"token_acc": 0.5080334917402127,
"train_speed(iter/s)": 0.195396
},
{
"epoch": 0.046224961479198766,
"grad_norm": 1.7222634553909302,
"learning_rate": 3.846153846153846e-05,
"loss": 2.218343734741211,
"memory(GiB)": 55.69,
"step": 120,
"token_acc": 0.5067487098054784,
"train_speed(iter/s)": 0.200238
},
{
"epoch": 0.04815100154083205,
"grad_norm": 0.6409298777580261,
"learning_rate": 4.006410256410257e-05,
"loss": 2.2596677780151366,
"memory(GiB)": 67.24,
"step": 125,
"token_acc": 0.5263391864858857,
"train_speed(iter/s)": 0.19248
},
{
"epoch": 0.05007704160246533,
"grad_norm": 0.7833207845687866,
"learning_rate": 4.1666666666666665e-05,
"loss": 2.2613948822021483,
"memory(GiB)": 67.24,
"step": 130,
"token_acc": 0.5279594851234438,
"train_speed(iter/s)": 0.197018
},
{
"epoch": 0.052003081664098616,
"grad_norm": 0.860501766204834,
"learning_rate": 4.3269230769230766e-05,
"loss": 2.2229248046875,
"memory(GiB)": 67.24,
"step": 135,
"token_acc": 0.5466706302021404,
"train_speed(iter/s)": 0.191379
},
{
"epoch": 0.053929121725731895,
"grad_norm": 0.8541775345802307,
"learning_rate": 4.4871794871794874e-05,
"loss": 2.3190549850463866,
"memory(GiB)": 67.24,
"step": 140,
"token_acc": 0.5198630136986301,
"train_speed(iter/s)": 0.195681
},
{
"epoch": 0.05585516178736518,
"grad_norm": 0.887022852897644,
"learning_rate": 4.6474358974358976e-05,
"loss": 2.2810138702392577,
"memory(GiB)": 67.24,
"step": 145,
"token_acc": 0.5373987613149118,
"train_speed(iter/s)": 0.193352
},
{
"epoch": 0.05778120184899846,
"grad_norm": 2.0370540618896484,
"learning_rate": 4.8076923076923084e-05,
"loss": 2.210652542114258,
"memory(GiB)": 67.24,
"step": 150,
"token_acc": 0.5223017621145375,
"train_speed(iter/s)": 0.195975
},
{
"epoch": 0.05970724191063174,
"grad_norm": 0.9455615878105164,
"learning_rate": 4.967948717948718e-05,
"loss": 2.20838623046875,
"memory(GiB)": 67.24,
"step": 155,
"token_acc": 0.5513654096228868,
"train_speed(iter/s)": 0.199862
},
{
"epoch": 0.061633281972265024,
"grad_norm": 0.6158351302146912,
"learning_rate": 5.128205128205128e-05,
"loss": 2.179709243774414,
"memory(GiB)": 67.24,
"step": 160,
"token_acc": 0.5072685539403213,
"train_speed(iter/s)": 0.196018
},
{
"epoch": 0.0635593220338983,
"grad_norm": 0.8856829404830933,
"learning_rate": 5.288461538461539e-05,
"loss": 2.2983753204345705,
"memory(GiB)": 67.24,
"step": 165,
"token_acc": 0.49867181840135233,
"train_speed(iter/s)": 0.199352
},
{
"epoch": 0.06548536209553159,
"grad_norm": 0.7724166512489319,
"learning_rate": 5.448717948717949e-05,
"loss": 2.2879966735839843,
"memory(GiB)": 67.24,
"step": 170,
"token_acc": 0.5076196608714316,
"train_speed(iter/s)": 0.197413
},
{
"epoch": 0.06741140215716487,
"grad_norm": 4.146669864654541,
"learning_rate": 5.608974358974359e-05,
"loss": 2.3056015014648437,
"memory(GiB)": 67.24,
"step": 175,
"token_acc": 0.5283564814814815,
"train_speed(iter/s)": 0.198077
},
{
"epoch": 0.06933744221879815,
"grad_norm": 0.8423267006874084,
"learning_rate": 5.76923076923077e-05,
"loss": 2.243014907836914,
"memory(GiB)": 67.24,
"step": 180,
"token_acc": 0.524451939291737,
"train_speed(iter/s)": 0.201027
},
{
"epoch": 0.07126348228043143,
"grad_norm": 5.1034650802612305,
"learning_rate": 5.929487179487179e-05,
"loss": 2.196868133544922,
"memory(GiB)": 79.85,
"step": 185,
"token_acc": 0.5295799428194414,
"train_speed(iter/s)": 0.197658
},
{
"epoch": 0.07318952234206472,
"grad_norm": 0.7008342146873474,
"learning_rate": 6.08974358974359e-05,
"loss": 2.2257001876831053,
"memory(GiB)": 79.85,
"step": 190,
"token_acc": 0.5335993280134397,
"train_speed(iter/s)": 0.199699
},
{
"epoch": 0.075115562403698,
"grad_norm": 2.709761381149292,
"learning_rate": 6.25e-05,
"loss": 2.246750259399414,
"memory(GiB)": 79.85,
"step": 195,
"token_acc": 0.5247820100963745,
"train_speed(iter/s)": 0.198348
},
{
"epoch": 0.07704160246533127,
"grad_norm": 0.6688154935836792,
"learning_rate": 6.41025641025641e-05,
"loss": 2.338885498046875,
"memory(GiB)": 79.85,
"step": 200,
"token_acc": 0.5158970476911431,
"train_speed(iter/s)": 0.201319
},
{
"epoch": 0.07896764252696456,
"grad_norm": 0.7070778012275696,
"learning_rate": 6.57051282051282e-05,
"loss": 2.2234432220458986,
"memory(GiB)": 79.85,
"step": 205,
"token_acc": 0.5176201372997712,
"train_speed(iter/s)": 0.199844
},
{
"epoch": 0.08089368258859785,
"grad_norm": 0.7464547753334045,
"learning_rate": 6.73076923076923e-05,
"loss": 2.297138977050781,
"memory(GiB)": 79.85,
"step": 210,
"token_acc": 0.5106699751861042,
"train_speed(iter/s)": 0.201068
},
{
"epoch": 0.08281972265023113,
"grad_norm": 0.6286822557449341,
"learning_rate": 6.891025641025642e-05,
"loss": 2.229446601867676,
"memory(GiB)": 79.85,
"step": 215,
"token_acc": 0.5232629637220741,
"train_speed(iter/s)": 0.203549
},
{
"epoch": 0.0847457627118644,
"grad_norm": 0.6389124989509583,
"learning_rate": 7.051282051282051e-05,
"loss": 2.2447444915771486,
"memory(GiB)": 79.85,
"step": 220,
"token_acc": 0.5157593123209169,
"train_speed(iter/s)": 0.200456
},
{
"epoch": 0.08667180277349769,
"grad_norm": 1.6869045495986938,
"learning_rate": 7.211538461538461e-05,
"loss": 2.2634090423583983,
"memory(GiB)": 79.85,
"step": 225,
"token_acc": 0.5259638080251771,
"train_speed(iter/s)": 0.203142
},
{
"epoch": 0.08859784283513097,
"grad_norm": 1.095736026763916,
"learning_rate": 7.371794871794872e-05,
"loss": 2.235662078857422,
"memory(GiB)": 79.85,
"step": 230,
"token_acc": 0.5303529411764706,
"train_speed(iter/s)": 0.201621
},
{
"epoch": 0.09052388289676425,
"grad_norm": 1.024219036102295,
"learning_rate": 7.532051282051282e-05,
"loss": 2.2247970581054686,
"memory(GiB)": 79.85,
"step": 235,
"token_acc": 0.5455431076473454,
"train_speed(iter/s)": 0.204201
},
{
"epoch": 0.09244992295839753,
"grad_norm": 1.3048988580703735,
"learning_rate": 7.692307692307693e-05,
"loss": 2.2020389556884767,
"memory(GiB)": 79.85,
"step": 240,
"token_acc": 0.5023310023310024,
"train_speed(iter/s)": 0.206181
},
{
"epoch": 0.09437596302003082,
"grad_norm": 0.9033989906311035,
"learning_rate": 7.852564102564103e-05,
"loss": 2.202723503112793,
"memory(GiB)": 79.85,
"step": 245,
"token_acc": 0.5280989513310029,
"train_speed(iter/s)": 0.202688
},
{
"epoch": 0.0963020030816641,
"grad_norm": 0.6796330809593201,
"learning_rate": 8.012820512820514e-05,
"loss": 2.233873748779297,
"memory(GiB)": 79.85,
"step": 250,
"token_acc": 0.5017253278122843,
"train_speed(iter/s)": 0.204961
},
{
"epoch": 0.09822804314329737,
"grad_norm": 1.8503941297531128,
"learning_rate": 8.173076923076923e-05,
"loss": 2.201646423339844,
"memory(GiB)": 79.85,
"step": 255,
"token_acc": 0.5372055674518201,
"train_speed(iter/s)": 0.201749
},
{
"epoch": 0.10015408320493066,
"grad_norm": 1.759498119354248,
"learning_rate": 8.333333333333333e-05,
"loss": 2.210206985473633,
"memory(GiB)": 79.85,
"step": 260,
"token_acc": 0.5258378378378379,
"train_speed(iter/s)": 0.204008
},
{
"epoch": 0.10208012326656395,
"grad_norm": 1.558002233505249,
"learning_rate": 8.493589743589745e-05,
"loss": 2.3287845611572267,
"memory(GiB)": 79.85,
"step": 265,
"token_acc": 0.5165515598952132,
"train_speed(iter/s)": 0.203423
},
{
"epoch": 0.10400616332819723,
"grad_norm": 2.7055013179779053,
"learning_rate": 8.653846153846153e-05,
"loss": 2.2146034240722656,
"memory(GiB)": 79.85,
"step": 270,
"token_acc": 0.5245828698553949,
"train_speed(iter/s)": 0.202798
},
{
"epoch": 0.1059322033898305,
"grad_norm": 0.9891285300254822,
"learning_rate": 8.814102564102565e-05,
"loss": 2.188070297241211,
"memory(GiB)": 79.85,
"step": 275,
"token_acc": 0.5225942402247717,
"train_speed(iter/s)": 0.204975
},
{
"epoch": 0.10785824345146379,
"grad_norm": 0.9874178171157837,
"learning_rate": 8.974358974358975e-05,
"loss": 2.1638275146484376,
"memory(GiB)": 79.85,
"step": 280,
"token_acc": 0.5529093369418132,
"train_speed(iter/s)": 0.202735
},
{
"epoch": 0.10978428351309708,
"grad_norm": 0.7807070016860962,
"learning_rate": 9.134615384615384e-05,
"loss": 2.2683109283447265,
"memory(GiB)": 79.85,
"step": 285,
"token_acc": 0.5302190551596727,
"train_speed(iter/s)": 0.204627
},
{
"epoch": 0.11171032357473036,
"grad_norm": 0.6836365461349487,
"learning_rate": 9.294871794871795e-05,
"loss": 2.2368232727050783,
"memory(GiB)": 79.85,
"step": 290,
"token_acc": 0.5263838592860838,
"train_speed(iter/s)": 0.202544
},
{
"epoch": 0.11363636363636363,
"grad_norm": 0.9923797845840454,
"learning_rate": 9.455128205128205e-05,
"loss": 2.152564811706543,
"memory(GiB)": 79.85,
"step": 295,
"token_acc": 0.5188876013904983,
"train_speed(iter/s)": 0.204553
},
{
"epoch": 0.11556240369799692,
"grad_norm": 0.7536174654960632,
"learning_rate": 9.615384615384617e-05,
"loss": 2.157516860961914,
"memory(GiB)": 79.85,
"step": 300,
"token_acc": 0.5454342487162313,
"train_speed(iter/s)": 0.20622
},
{
"epoch": 0.1174884437596302,
"grad_norm": 7.1967549324035645,
"learning_rate": 9.775641025641025e-05,
"loss": 2.0982955932617187,
"memory(GiB)": 79.85,
"step": 305,
"token_acc": 0.5410308090987619,
"train_speed(iter/s)": 0.203884
},
{
"epoch": 0.11941448382126348,
"grad_norm": 0.5281727910041809,
"learning_rate": 9.935897435897436e-05,
"loss": 2.2395370483398436,
"memory(GiB)": 79.85,
"step": 310,
"token_acc": 0.5202040816326531,
"train_speed(iter/s)": 0.20575
},
{
"epoch": 0.12134052388289676,
"grad_norm": 1.5248783826828003,
"learning_rate": 0.00010096153846153847,
"loss": 2.281228256225586,
"memory(GiB)": 79.85,
"step": 315,
"token_acc": 0.5254635675110995,
"train_speed(iter/s)": 0.203526
},
{
"epoch": 0.12326656394453005,
"grad_norm": 0.8702052235603333,
"learning_rate": 0.00010256410256410256,
"loss": 2.172785758972168,
"memory(GiB)": 79.85,
"step": 320,
"token_acc": 0.5519110096976612,
"train_speed(iter/s)": 0.205369
},
{
"epoch": 0.12519260400616333,
"grad_norm": 2.1862897872924805,
"learning_rate": 0.00010416666666666667,
"loss": 2.23248291015625,
"memory(GiB)": 79.85,
"step": 325,
"token_acc": 0.5359653866955111,
"train_speed(iter/s)": 0.206137
},
{
"epoch": 0.1271186440677966,
"grad_norm": 0.6504359245300293,
"learning_rate": 0.00010576923076923077,
"loss": 2.1315258026123045,
"memory(GiB)": 79.85,
"step": 330,
"token_acc": 0.5330889092575619,
"train_speed(iter/s)": 0.207189
},
{
"epoch": 0.1290446841294299,
"grad_norm": 1.1709946393966675,
"learning_rate": 0.00010737179487179486,
"loss": 2.1950706481933593,
"memory(GiB)": 79.85,
"step": 335,
"token_acc": 0.5084640792733278,
"train_speed(iter/s)": 0.206613
},
{
"epoch": 0.13097072419106318,
"grad_norm": 0.46994733810424805,
"learning_rate": 0.00010897435897435898,
"loss": 2.2042753219604494,
"memory(GiB)": 79.85,
"step": 340,
"token_acc": 0.5417880349540668,
"train_speed(iter/s)": 0.206589
},
{
"epoch": 0.13289676425269645,
"grad_norm": 1.0993995666503906,
"learning_rate": 0.00011057692307692308,
"loss": 2.2882259368896483,
"memory(GiB)": 79.85,
"step": 345,
"token_acc": 0.5274168685311605,
"train_speed(iter/s)": 0.206101
},
{
"epoch": 0.13482280431432975,
"grad_norm": 0.5390233397483826,
"learning_rate": 0.00011217948717948718,
"loss": 2.251546859741211,
"memory(GiB)": 79.85,
"step": 350,
"token_acc": 0.548828125,
"train_speed(iter/s)": 0.205565
},
{
"epoch": 0.13674884437596302,
"grad_norm": 0.5272419452667236,
"learning_rate": 0.00011378205128205128,
"loss": 2.2364831924438477,
"memory(GiB)": 79.85,
"step": 355,
"token_acc": 0.5096008084891359,
"train_speed(iter/s)": 0.207208
},
{
"epoch": 0.1386748844375963,
"grad_norm": 0.5430485010147095,
"learning_rate": 0.0001153846153846154,
"loss": 2.2397247314453126,
"memory(GiB)": 79.85,
"step": 360,
"token_acc": 0.5234200743494424,
"train_speed(iter/s)": 0.208354
},
{
"epoch": 0.1406009244992296,
"grad_norm": 0.7808792591094971,
"learning_rate": 0.0001169871794871795,
"loss": 2.282427978515625,
"memory(GiB)": 79.85,
"step": 365,
"token_acc": 0.5037704231252619,
"train_speed(iter/s)": 0.206541
},
{
"epoch": 0.14252696456086286,
"grad_norm": 0.4293100833892822,
"learning_rate": 0.00011858974358974358,
"loss": 2.214054489135742,
"memory(GiB)": 79.85,
"step": 370,
"token_acc": 0.5278355278355278,
"train_speed(iter/s)": 0.207825
},
{
"epoch": 0.14445300462249616,
"grad_norm": 0.9003456234931946,
"learning_rate": 0.0001201923076923077,
"loss": 2.1916942596435547,
"memory(GiB)": 79.85,
"step": 375,
"token_acc": 0.5359328950351394,
"train_speed(iter/s)": 0.204903
},
{
"epoch": 0.14637904468412943,
"grad_norm": 0.7104191184043884,
"learning_rate": 0.0001217948717948718,
"loss": 2.247498321533203,
"memory(GiB)": 79.85,
"step": 380,
"token_acc": 0.5167552576843079,
"train_speed(iter/s)": 0.206413
},
{
"epoch": 0.1483050847457627,
"grad_norm": 0.5338280200958252,
"learning_rate": 0.0001233974358974359,
"loss": 2.1627017974853517,
"memory(GiB)": 79.85,
"step": 385,
"token_acc": 0.53835585069842,
"train_speed(iter/s)": 0.206429
},
{
"epoch": 0.150231124807396,
"grad_norm": 1.5957274436950684,
"learning_rate": 0.000125,
"loss": 2.2079803466796877,
"memory(GiB)": 79.85,
"step": 390,
"token_acc": 0.531615925058548,
"train_speed(iter/s)": 0.20449
},
{
"epoch": 0.15215716486902928,
"grad_norm": 0.7144642472267151,
"learning_rate": 0.00012499985911623197,
"loss": 2.2493335723876955,
"memory(GiB)": 79.85,
"step": 395,
"token_acc": 0.5375455650060753,
"train_speed(iter/s)": 0.20601
},
{
"epoch": 0.15408320493066255,
"grad_norm": 0.6453521847724915,
"learning_rate": 0.000124999436465563,
"loss": 2.182133102416992,
"memory(GiB)": 79.85,
"step": 400,
"token_acc": 0.5343928482741495,
"train_speed(iter/s)": 0.203363
},
{
"epoch": 0.15600924499229585,
"grad_norm": 0.6827189326286316,
"learning_rate": 0.00012499873204989856,
"loss": 2.216513824462891,
"memory(GiB)": 79.85,
"step": 405,
"token_acc": 0.5300488426417499,
"train_speed(iter/s)": 0.204854
},
{
"epoch": 0.15793528505392912,
"grad_norm": 0.6293906569480896,
"learning_rate": 0.0001249977458724143,
"loss": 2.1550098419189454,
"memory(GiB)": 79.85,
"step": 410,
"token_acc": 0.5417820867959372,
"train_speed(iter/s)": 0.20197
},
{
"epoch": 0.1598613251155624,
"grad_norm": 0.5983798503875732,
"learning_rate": 0.00012499647793755622,
"loss": 2.196070098876953,
"memory(GiB)": 79.85,
"step": 415,
"token_acc": 0.526906878802059,
"train_speed(iter/s)": 0.203399
},
{
"epoch": 0.1617873651771957,
"grad_norm": 5.2007737159729,
"learning_rate": 0.00012499492825104053,
"loss": 2.2286691665649414,
"memory(GiB)": 79.85,
"step": 420,
"token_acc": 0.5239111870196413,
"train_speed(iter/s)": 0.204811
},
{
"epoch": 0.16371340523882896,
"grad_norm": 0.4801613986492157,
"learning_rate": 0.00012499309681985362,
"loss": 2.228078842163086,
"memory(GiB)": 79.85,
"step": 425,
"token_acc": 0.520584652862363,
"train_speed(iter/s)": 0.203128
},
{
"epoch": 0.16563944530046226,
"grad_norm": 1.7402924299240112,
"learning_rate": 0.00012499098365225213,
"loss": 2.1930723190307617,
"memory(GiB)": 79.85,
"step": 430,
"token_acc": 0.537429568017172,
"train_speed(iter/s)": 0.20453
},
{
"epoch": 0.16756548536209553,
"grad_norm": 0.6129881143569946,
"learning_rate": 0.0001249885887577628,
"loss": 2.139969825744629,
"memory(GiB)": 79.85,
"step": 435,
"token_acc": 0.5450490633363069,
"train_speed(iter/s)": 0.201099
},
{
"epoch": 0.1694915254237288,
"grad_norm": 0.6262999176979065,
"learning_rate": 0.00012498591214718248,
"loss": 2.212021255493164,
"memory(GiB)": 79.85,
"step": 440,
"token_acc": 0.5390710983931323,
"train_speed(iter/s)": 0.202387
},
{
"epoch": 0.1714175654853621,
"grad_norm": 0.9113600254058838,
"learning_rate": 0.00012498295383257807,
"loss": 2.0877065658569336,
"memory(GiB)": 79.85,
"step": 445,
"token_acc": 0.536497175141243,
"train_speed(iter/s)": 0.203434
},
{
"epoch": 0.17334360554699538,
"grad_norm": 0.47799283266067505,
"learning_rate": 0.0001249797138272865,
"loss": 2.2158781051635743,
"memory(GiB)": 79.85,
"step": 450,
"token_acc": 0.5326836225338721,
"train_speed(iter/s)": 0.202794
},
{
"epoch": 0.17526964560862865,
"grad_norm": 0.547575831413269,
"learning_rate": 0.00012497619214591463,
"loss": 2.2185787200927733,
"memory(GiB)": 79.85,
"step": 455,
"token_acc": 0.5258584145824502,
"train_speed(iter/s)": 0.204115
},
{
"epoch": 0.17719568567026195,
"grad_norm": 2.353126287460327,
"learning_rate": 0.0001249723888043392,
"loss": 2.216251182556152,
"memory(GiB)": 79.85,
"step": 460,
"token_acc": 0.533461620697028,
"train_speed(iter/s)": 0.202909
},
{
"epoch": 0.17912172573189522,
"grad_norm": 0.7597701549530029,
"learning_rate": 0.00012496830381970668,
"loss": 2.152217483520508,
"memory(GiB)": 79.85,
"step": 465,
"token_acc": 0.5328542094455853,
"train_speed(iter/s)": 0.204216
},
{
"epoch": 0.1810477657935285,
"grad_norm": 0.7759498357772827,
"learning_rate": 0.00012496393721043338,
"loss": 2.131561279296875,
"memory(GiB)": 79.85,
"step": 470,
"token_acc": 0.5186906445746615,
"train_speed(iter/s)": 0.202024
},
{
"epoch": 0.1829738058551618,
"grad_norm": 1.137546420097351,
"learning_rate": 0.0001249592889962052,
"loss": 2.1353374481201173,
"memory(GiB)": 79.85,
"step": 475,
"token_acc": 0.5248306997742663,
"train_speed(iter/s)": 0.203244
},
{
"epoch": 0.18489984591679506,
"grad_norm": 1.0947918891906738,
"learning_rate": 0.00012495435919797758,
"loss": 2.192966270446777,
"memory(GiB)": 79.85,
"step": 480,
"token_acc": 0.5140420220511753,
"train_speed(iter/s)": 0.20449
},
{
"epoch": 0.18682588597842836,
"grad_norm": 1.1944098472595215,
"learning_rate": 0.0001249491478379754,
"loss": 2.1541446685791015,
"memory(GiB)": 79.85,
"step": 485,
"token_acc": 0.5353901996370236,
"train_speed(iter/s)": 0.203804
},
{
"epoch": 0.18875192604006163,
"grad_norm": 1.2369686365127563,
"learning_rate": 0.000124943654939693,
"loss": 2.1915687561035155,
"memory(GiB)": 79.85,
"step": 490,
"token_acc": 0.5267611592976518,
"train_speed(iter/s)": 0.205019
},
{
"epoch": 0.1906779661016949,
"grad_norm": 0.7297829985618591,
"learning_rate": 0.00012493788052789386,
"loss": 2.184051513671875,
"memory(GiB)": 79.85,
"step": 495,
"token_acc": 0.5402985074626866,
"train_speed(iter/s)": 0.203977
},
{
"epoch": 0.1926040061633282,
"grad_norm": 1.6911697387695312,
"learning_rate": 0.00012493182462861068,
"loss": 2.233272171020508,
"memory(GiB)": 79.85,
"step": 500,
"token_acc": 0.5366824173091271,
"train_speed(iter/s)": 0.205157
},
{
"epoch": 0.19453004622496148,
"grad_norm": 0.7485533952713013,
"learning_rate": 0.0001249254872691451,
"loss": 2.175897979736328,
"memory(GiB)": 79.85,
"step": 505,
"token_acc": 0.5402777777777777,
"train_speed(iter/s)": 0.204111
},
{
"epoch": 0.19645608628659475,
"grad_norm": 0.48097991943359375,
"learning_rate": 0.00012491886847806777,
"loss": 2.190257453918457,
"memory(GiB)": 79.85,
"step": 510,
"token_acc": 0.5596064814814815,
"train_speed(iter/s)": 0.205268
},
{
"epoch": 0.19838212634822805,
"grad_norm": 0.8839398622512817,
"learning_rate": 0.00012491196828521802,
"loss": 2.1894506454467773,
"memory(GiB)": 79.85,
"step": 515,
"token_acc": 0.5173086299366163,
"train_speed(iter/s)": 0.206445
},
{
"epoch": 0.20030816640986132,
"grad_norm": 4.143980503082275,
"learning_rate": 0.00012490478672170388,
"loss": 2.1409215927124023,
"memory(GiB)": 79.85,
"step": 520,
"token_acc": 0.527306967984934,
"train_speed(iter/s)": 0.204274
},
{
"epoch": 0.20223420647149462,
"grad_norm": 1.3725707530975342,
"learning_rate": 0.00012489732381990184,
"loss": 2.1883153915405273,
"memory(GiB)": 79.85,
"step": 525,
"token_acc": 0.5199283475145544,
"train_speed(iter/s)": 0.205428
},
{
"epoch": 0.2041602465331279,
"grad_norm": 1.092573642730713,
"learning_rate": 0.00012488957961345678,
"loss": 2.2205310821533204,
"memory(GiB)": 79.85,
"step": 530,
"token_acc": 0.5519459633322612,
"train_speed(iter/s)": 0.204143
},
{
"epoch": 0.20608628659476116,
"grad_norm": 0.8245734572410583,
"learning_rate": 0.00012488155413728171,
"loss": 2.179944610595703,
"memory(GiB)": 79.85,
"step": 535,
"token_acc": 0.5104846225535881,
"train_speed(iter/s)": 0.205223
},
{
"epoch": 0.20801232665639446,
"grad_norm": 1.2626621723175049,
"learning_rate": 0.00012487324742755778,
"loss": 2.1643230438232424,
"memory(GiB)": 79.85,
"step": 540,
"token_acc": 0.5341967734605771,
"train_speed(iter/s)": 0.206319
},
{
"epoch": 0.20993836671802774,
"grad_norm": 0.750433623790741,
"learning_rate": 0.00012486465952173394,
"loss": 2.1548141479492187,
"memory(GiB)": 79.85,
"step": 545,
"token_acc": 0.5284785435630689,
"train_speed(iter/s)": 0.205458
},
{
"epoch": 0.211864406779661,
"grad_norm": 1.3458155393600464,
"learning_rate": 0.0001248557904585269,
"loss": 2.1688873291015627,
"memory(GiB)": 79.85,
"step": 550,
"token_acc": 0.5374526377149519,
"train_speed(iter/s)": 0.206561
},
{
"epoch": 0.2137904468412943,
"grad_norm": 1.7017052173614502,
"learning_rate": 0.00012484664027792081,
"loss": 2.1563148498535156,
"memory(GiB)": 79.85,
"step": 555,
"token_acc": 0.5385852090032154,
"train_speed(iter/s)": 0.205565
},
{
"epoch": 0.21571648690292758,
"grad_norm": 0.8666205406188965,
"learning_rate": 0.00012483720902116736,
"loss": 2.1540388107299804,
"memory(GiB)": 79.85,
"step": 560,
"token_acc": 0.5175918686473807,
"train_speed(iter/s)": 0.206598
},
{
"epoch": 0.21764252696456085,
"grad_norm": 1.5656309127807617,
"learning_rate": 0.0001248274967307852,
"loss": 2.1744287490844725,
"memory(GiB)": 79.85,
"step": 565,
"token_acc": 0.5209335899903753,
"train_speed(iter/s)": 0.205796
},
{
"epoch": 0.21956856702619415,
"grad_norm": 0.8936501145362854,
"learning_rate": 0.00012481750345056015,
"loss": 2.231153106689453,
"memory(GiB)": 79.85,
"step": 570,
"token_acc": 0.5342115611482501,
"train_speed(iter/s)": 0.206852
},
{
"epoch": 0.22149460708782742,
"grad_norm": 1.291582703590393,
"learning_rate": 0.0001248072292255447,
"loss": 2.195969009399414,
"memory(GiB)": 79.85,
"step": 575,
"token_acc": 0.5311691366737238,
"train_speed(iter/s)": 0.207793
},
{
"epoch": 0.22342064714946072,
"grad_norm": 0.6491249799728394,
"learning_rate": 0.00012479667410205785,
"loss": 2.173289489746094,
"memory(GiB)": 79.85,
"step": 580,
"token_acc": 0.53319357092942,
"train_speed(iter/s)": 0.206575
},
{
"epoch": 0.225346687211094,
"grad_norm": 2.2959673404693604,
"learning_rate": 0.00012478583812768518,
"loss": 2.1829410552978517,
"memory(GiB)": 79.85,
"step": 585,
"token_acc": 0.5279026712509918,
"train_speed(iter/s)": 0.207609
},
{
"epoch": 0.22727272727272727,
"grad_norm": 0.6624155044555664,
"learning_rate": 0.00012477472135127824,
"loss": 2.1412792205810547,
"memory(GiB)": 79.85,
"step": 590,
"token_acc": 0.5319976076555024,
"train_speed(iter/s)": 0.206578
},
{
"epoch": 0.22919876733436056,
"grad_norm": 2.478637218475342,
"learning_rate": 0.0001247633238229546,
"loss": 2.15417537689209,
"memory(GiB)": 79.85,
"step": 595,
"token_acc": 0.5192682926829268,
"train_speed(iter/s)": 0.207599
},
{
"epoch": 0.23112480739599384,
"grad_norm": 1.6136051416397095,
"learning_rate": 0.00012475164559409748,
"loss": 2.1549308776855467,
"memory(GiB)": 79.85,
"step": 600,
"token_acc": 0.5380829622685728,
"train_speed(iter/s)": 0.207515
},
{
"epoch": 0.2330508474576271,
"grad_norm": 1.033865213394165,
"learning_rate": 0.00012473968671735565,
"loss": 2.066006088256836,
"memory(GiB)": 79.85,
"step": 605,
"token_acc": 0.5451037144235408,
"train_speed(iter/s)": 0.207361
},
{
"epoch": 0.2349768875192604,
"grad_norm": 1.171897053718567,
"learning_rate": 0.00012472744724664305,
"loss": 2.152410125732422,
"memory(GiB)": 79.85,
"step": 610,
"token_acc": 0.5231010180109632,
"train_speed(iter/s)": 0.208312
},
{
"epoch": 0.23690292758089368,
"grad_norm": 2.0283079147338867,
"learning_rate": 0.0001247149272371387,
"loss": 2.111717414855957,
"memory(GiB)": 79.85,
"step": 615,
"token_acc": 0.5375532961626763,
"train_speed(iter/s)": 0.206514
},
{
"epoch": 0.23882896764252695,
"grad_norm": 1.5509942770004272,
"learning_rate": 0.00012470212674528628,
"loss": 2.147776222229004,
"memory(GiB)": 79.85,
"step": 620,
"token_acc": 0.5202908749706779,
"train_speed(iter/s)": 0.207458
},
{
"epoch": 0.24075500770416025,
"grad_norm": 0.6883136034011841,
"learning_rate": 0.00012468904582879398,
"loss": 2.1620344161987304,
"memory(GiB)": 79.85,
"step": 625,
"token_acc": 0.53108228980322,
"train_speed(iter/s)": 0.206865
},
{
"epoch": 0.24268104776579352,
"grad_norm": 0.9905964732170105,
"learning_rate": 0.00012467568454663426,
"loss": 2.136301040649414,
"memory(GiB)": 79.85,
"step": 630,
"token_acc": 0.5512849670229703,
"train_speed(iter/s)": 0.206729
},
{
"epoch": 0.24460708782742682,
"grad_norm": 1.9961880445480347,
"learning_rate": 0.00012466204295904354,
"loss": 2.089532470703125,
"memory(GiB)": 79.85,
"step": 635,
"token_acc": 0.5415720127214902,
"train_speed(iter/s)": 0.206941
},
{
"epoch": 0.2465331278890601,
"grad_norm": 0.7378602027893066,
"learning_rate": 0.0001246481211275219,
"loss": 2.1900714874267577,
"memory(GiB)": 79.85,
"step": 640,
"token_acc": 0.519208381839348,
"train_speed(iter/s)": 0.206255
},
{
"epoch": 0.24845916795069337,
"grad_norm": 0.7011188268661499,
"learning_rate": 0.0001246339191148329,
"loss": 2.1525733947753904,
"memory(GiB)": 79.85,
"step": 645,
"token_acc": 0.539046010975095,
"train_speed(iter/s)": 0.207188
},
{
"epoch": 0.25038520801232667,
"grad_norm": 1.2385390996932983,
"learning_rate": 0.0001246194369850032,
"loss": 2.1426889419555666,
"memory(GiB)": 79.85,
"step": 650,
"token_acc": 0.5399509803921568,
"train_speed(iter/s)": 0.20529
},
{
"epoch": 0.25231124807395994,
"grad_norm": 0.9886940717697144,
"learning_rate": 0.00012460467480332222,
"loss": 2.145462989807129,
"memory(GiB)": 79.85,
"step": 655,
"token_acc": 0.5274824700294051,
"train_speed(iter/s)": 0.206216
},
{
"epoch": 0.2542372881355932,
"grad_norm": 0.756267786026001,
"learning_rate": 0.0001245896326363421,
"loss": 2.103159713745117,
"memory(GiB)": 79.85,
"step": 660,
"token_acc": 0.5443285528031291,
"train_speed(iter/s)": 0.207107
},
{
"epoch": 0.2561633281972265,
"grad_norm": 0.7367931604385376,
"learning_rate": 0.00012457431055187715,
"loss": 2.1234664916992188,
"memory(GiB)": 79.85,
"step": 665,
"token_acc": 0.5417185554171855,
"train_speed(iter/s)": 0.206003
},
{
"epoch": 0.2580893682588598,
"grad_norm": 0.8494862914085388,
"learning_rate": 0.0001245587086190036,
"loss": 2.1641502380371094,
"memory(GiB)": 79.85,
"step": 670,
"token_acc": 0.5548288641813822,
"train_speed(iter/s)": 0.206884
},
{
"epoch": 0.2600154083204931,
"grad_norm": 0.9068291187286377,
"learning_rate": 0.0001245428269080593,
"loss": 2.0993995666503906,
"memory(GiB)": 79.85,
"step": 675,
"token_acc": 0.5394105551747772,
"train_speed(iter/s)": 0.205466
},
{
"epoch": 0.26194144838212635,
"grad_norm": 1.0292894840240479,
"learning_rate": 0.00012452666549064354,
"loss": 2.2421758651733397,
"memory(GiB)": 79.85,
"step": 680,
"token_acc": 0.5255948089401586,
"train_speed(iter/s)": 0.206359
},
{
"epoch": 0.2638674884437596,
"grad_norm": 0.7002666592597961,
"learning_rate": 0.00012451022443961648,
"loss": 2.2322803497314454,
"memory(GiB)": 79.85,
"step": 685,
"token_acc": 0.5309630327289852,
"train_speed(iter/s)": 0.207236
},
{
"epoch": 0.2657935285053929,
"grad_norm": 0.7977465391159058,
"learning_rate": 0.000124493503829099,
"loss": 2.1305238723754885,
"memory(GiB)": 79.85,
"step": 690,
"token_acc": 0.5295850724281856,
"train_speed(iter/s)": 0.205618
},
{
"epoch": 0.26771956856702617,
"grad_norm": 0.776294469833374,
"learning_rate": 0.0001244765037344723,
"loss": 2.162790298461914,
"memory(GiB)": 79.85,
"step": 695,
"token_acc": 0.5114279248698801,
"train_speed(iter/s)": 0.206468
},
{
"epoch": 0.2696456086286595,
"grad_norm": 0.8615128993988037,
"learning_rate": 0.0001244592242323776,
"loss": 2.1106941223144533,
"memory(GiB)": 79.85,
"step": 700,
"token_acc": 0.5509896729776248,
"train_speed(iter/s)": 0.205448
},
{
"epoch": 0.27157164869029277,
"grad_norm": 0.6523112654685974,
"learning_rate": 0.00012444166540071568,
"loss": 2.152960205078125,
"memory(GiB)": 79.85,
"step": 705,
"token_acc": 0.5195206803247004,
"train_speed(iter/s)": 0.206286
},
{
"epoch": 0.27349768875192604,
"grad_norm": 1.0108753442764282,
"learning_rate": 0.00012442382731864675,
"loss": 2.178171157836914,
"memory(GiB)": 79.85,
"step": 710,
"token_acc": 0.5352564102564102,
"train_speed(iter/s)": 0.205308
},
{
"epoch": 0.2754237288135593,
"grad_norm": 1.3268048763275146,
"learning_rate": 0.00012440571006658985,
"loss": 2.136724853515625,
"memory(GiB)": 79.85,
"step": 715,
"token_acc": 0.5580524344569289,
"train_speed(iter/s)": 0.206154
},
{
"epoch": 0.2773497688751926,
"grad_norm": 1.2465232610702515,
"learning_rate": 0.00012438731372622265,
"loss": 2.1769336700439452,
"memory(GiB)": 79.85,
"step": 720,
"token_acc": 0.5532096395820004,
"train_speed(iter/s)": 0.206973
},
{
"epoch": 0.2792758089368259,
"grad_norm": 1.9088857173919678,
"learning_rate": 0.00012436863838048102,
"loss": 2.1059314727783205,
"memory(GiB)": 79.85,
"step": 725,
"token_acc": 0.5443349753694581,
"train_speed(iter/s)": 0.206383
},
{
"epoch": 0.2812018489984592,
"grad_norm": 1.2093032598495483,
"learning_rate": 0.00012434968411355863,
"loss": 2.1533790588378907,
"memory(GiB)": 79.85,
"step": 730,
"token_acc": 0.5251533742331288,
"train_speed(iter/s)": 0.207214
},
{
"epoch": 0.28312788906009245,
"grad_norm": 1.328275203704834,
"learning_rate": 0.00012433045101090665,
"loss": 2.1687450408935547,
"memory(GiB)": 79.85,
"step": 735,
"token_acc": 0.5401069518716578,
"train_speed(iter/s)": 0.206175
},
{
"epoch": 0.2850539291217257,
"grad_norm": 0.8366193175315857,
"learning_rate": 0.00012431093915923333,
"loss": 2.1700584411621096,
"memory(GiB)": 79.85,
"step": 740,
"token_acc": 0.5420981539846916,
"train_speed(iter/s)": 0.206949
},
{
"epoch": 0.286979969183359,
"grad_norm": 0.5917710661888123,
"learning_rate": 0.0001242911486465035,
"loss": 2.1334373474121096,
"memory(GiB)": 79.85,
"step": 745,
"token_acc": 0.5226154206702601,
"train_speed(iter/s)": 0.207764
},
{
"epoch": 0.2889060092449923,
"grad_norm": 0.5300167202949524,
"learning_rate": 0.00012427107956193846,
"loss": 2.157124900817871,
"memory(GiB)": 79.85,
"step": 750,
"token_acc": 0.537828947368421,
"train_speed(iter/s)": 0.206411
},
{
"epoch": 0.2908320493066256,
"grad_norm": 2.3136775493621826,
"learning_rate": 0.00012425073199601514,
"loss": 2.154123306274414,
"memory(GiB)": 79.85,
"step": 755,
"token_acc": 0.5495611770779556,
"train_speed(iter/s)": 0.207199
},
{
"epoch": 0.29275808936825887,
"grad_norm": 0.5608005523681641,
"learning_rate": 0.00012423010604046617,
"loss": 2.128403091430664,
"memory(GiB)": 79.85,
"step": 760,
"token_acc": 0.5565662308129619,
"train_speed(iter/s)": 0.206742
},
{
"epoch": 0.29468412942989214,
"grad_norm": 1.7282224893569946,
"learning_rate": 0.0001242092017882791,
"loss": 2.0894710540771486,
"memory(GiB)": 79.85,
"step": 765,
"token_acc": 0.5356890459363958,
"train_speed(iter/s)": 0.206811
},
{
"epoch": 0.2966101694915254,
"grad_norm": 0.66438889503479,
"learning_rate": 0.00012418801933369622,
"loss": 2.145112991333008,
"memory(GiB)": 79.85,
"step": 770,
"token_acc": 0.5387755102040817,
"train_speed(iter/s)": 0.206595
},
{
"epoch": 0.2985362095531587,
"grad_norm": 1.0348610877990723,
"learning_rate": 0.0001241665587722139,
"loss": 2.110944366455078,
"memory(GiB)": 79.85,
"step": 775,
"token_acc": 0.5398929983717143,
"train_speed(iter/s)": 0.20699
},
{
"epoch": 0.300462249614792,
"grad_norm": 0.7911678552627563,
"learning_rate": 0.00012414482020058244,
"loss": 2.106073760986328,
"memory(GiB)": 79.85,
"step": 780,
"token_acc": 0.5268990995151235,
"train_speed(iter/s)": 0.207758
},
{
"epoch": 0.3023882896764253,
"grad_norm": 0.6585643887519836,
"learning_rate": 0.00012412280371680538,
"loss": 2.180895233154297,
"memory(GiB)": 79.85,
"step": 785,
"token_acc": 0.5228360156589822,
"train_speed(iter/s)": 0.20744
},
{
"epoch": 0.30431432973805855,
"grad_norm": 1.980449914932251,
"learning_rate": 0.0001241005094201392,
"loss": 2.1610347747802736,
"memory(GiB)": 79.85,
"step": 790,
"token_acc": 0.532167530224525,
"train_speed(iter/s)": 0.207829
},
{
"epoch": 0.3062403697996918,
"grad_norm": 1.8646785020828247,
"learning_rate": 0.00012407793741109287,
"loss": 2.123297691345215,
"memory(GiB)": 79.85,
"step": 795,
"token_acc": 0.523725834797891,
"train_speed(iter/s)": 0.20703
},
{
"epoch": 0.3081664098613251,
"grad_norm": 1.4203855991363525,
"learning_rate": 0.00012405508779142734,
"loss": 2.138237190246582,
"memory(GiB)": 79.85,
"step": 800,
"token_acc": 0.5363815142576205,
"train_speed(iter/s)": 0.207628
},
{
"epoch": 0.3100924499229584,
"grad_norm": 0.4977465569972992,
"learning_rate": 0.00012403196066415508,
"loss": 2.1467048645019533,
"memory(GiB)": 79.85,
"step": 805,
"token_acc": 0.5474415016713808,
"train_speed(iter/s)": 0.207779
},
{
"epoch": 0.3120184899845917,
"grad_norm": 1.7817529439926147,
"learning_rate": 0.00012400855613353974,
"loss": 2.1157253265380858,
"memory(GiB)": 79.85,
"step": 810,
"token_acc": 0.5336831059811122,
"train_speed(iter/s)": 0.207152
},
{
"epoch": 0.31394453004622497,
"grad_norm": 1.0420174598693848,
"learning_rate": 0.00012398487430509541,
"loss": 2.1837884902954103,
"memory(GiB)": 79.85,
"step": 815,
"token_acc": 0.5418866192334175,
"train_speed(iter/s)": 0.207897
},
{
"epoch": 0.31587057010785824,
"grad_norm": 0.8049368262290955,
"learning_rate": 0.00012396091528558647,
"loss": 2.0642932891845702,
"memory(GiB)": 79.85,
"step": 820,
"token_acc": 0.5254824344383968,
"train_speed(iter/s)": 0.207387
},
{
"epoch": 0.3177966101694915,
"grad_norm": 0.7703681588172913,
"learning_rate": 0.0001239366791830269,
"loss": 2.1248165130615235,
"memory(GiB)": 79.85,
"step": 825,
"token_acc": 0.5299837925445705,
"train_speed(iter/s)": 0.207841
},
{
"epoch": 0.3197226502311248,
"grad_norm": 0.7251123189926147,
"learning_rate": 0.00012391216610667987,
"loss": 2.119538116455078,
"memory(GiB)": 79.85,
"step": 830,
"token_acc": 0.5522290920924179,
"train_speed(iter/s)": 0.206827
},
{
"epoch": 0.3216486902927581,
"grad_norm": 2.997692823410034,
"learning_rate": 0.00012388737616705718,
"loss": 2.15743408203125,
"memory(GiB)": 79.85,
"step": 835,
"token_acc": 0.5239942822136001,
"train_speed(iter/s)": 0.207532
},
{
"epoch": 0.3235747303543914,
"grad_norm": 0.6147775053977966,
"learning_rate": 0.00012386230947591882,
"loss": 2.089567947387695,
"memory(GiB)": 79.85,
"step": 840,
"token_acc": 0.5160835876966424,
"train_speed(iter/s)": 0.208252
},
{
"epoch": 0.32550077041602465,
"grad_norm": 0.7132768630981445,
"learning_rate": 0.0001238369661462725,
"loss": 2.1357202529907227,
"memory(GiB)": 79.85,
"step": 845,
"token_acc": 0.5417991821899136,
"train_speed(iter/s)": 0.207421
},
{
"epoch": 0.3274268104776579,
"grad_norm": 1.0247437953948975,
"learning_rate": 0.00012381134629237302,
"loss": 2.1768089294433595,
"memory(GiB)": 79.85,
"step": 850,
"token_acc": 0.5084491978609625,
"train_speed(iter/s)": 0.208129
},
{
"epoch": 0.3293528505392912,
"grad_norm": 1.1053919792175293,
"learning_rate": 0.0001237854500297219,
"loss": 2.145914840698242,
"memory(GiB)": 79.85,
"step": 855,
"token_acc": 0.5334768053562888,
"train_speed(iter/s)": 0.207464
},
{
"epoch": 0.3312788906009245,
"grad_norm": 0.6999503374099731,
"learning_rate": 0.00012375927747506677,
"loss": 2.1366676330566405,
"memory(GiB)": 79.85,
"step": 860,
"token_acc": 0.5351328191945158,
"train_speed(iter/s)": 0.20817
},
{
"epoch": 0.3332049306625578,
"grad_norm": 1.1189074516296387,
"learning_rate": 0.0001237328287464008,
"loss": 2.0361764907836912,
"memory(GiB)": 79.85,
"step": 865,
"token_acc": 0.5393548387096774,
"train_speed(iter/s)": 0.208608
},
{
"epoch": 0.33513097072419107,
"grad_norm": 1.0416418313980103,
"learning_rate": 0.00012370610396296236,
"loss": 2.035050964355469,
"memory(GiB)": 79.85,
"step": 870,
"token_acc": 0.551981252662974,
"train_speed(iter/s)": 0.20817
},
{
"epoch": 0.33705701078582434,
"grad_norm": 1.1505193710327148,
"learning_rate": 0.0001236791032452342,
"loss": 2.038909912109375,
"memory(GiB)": 79.85,
"step": 875,
"token_acc": 0.5669099756690997,
"train_speed(iter/s)": 0.208772
},
{
"epoch": 0.3389830508474576,
"grad_norm": 1.1256943941116333,
"learning_rate": 0.00012365182671494318,
"loss": 2.0859130859375,
"memory(GiB)": 79.85,
"step": 880,
"token_acc": 0.539801596902976,
"train_speed(iter/s)": 0.20818
},
{
"epoch": 0.3409090909090909,
"grad_norm": 1.0799412727355957,
"learning_rate": 0.0001236242744950595,
"loss": 2.125068473815918,
"memory(GiB)": 79.85,
"step": 885,
"token_acc": 0.5248287671232876,
"train_speed(iter/s)": 0.208844
},
{
"epoch": 0.3428351309707242,
"grad_norm": 1.5209028720855713,
"learning_rate": 0.00012359644670979634,
"loss": 2.077609825134277,
"memory(GiB)": 79.85,
"step": 890,
"token_acc": 0.5318967356518028,
"train_speed(iter/s)": 0.207845
},
{
"epoch": 0.3447611710323575,
"grad_norm": 1.0139696598052979,
"learning_rate": 0.00012356834348460914,
"loss": 2.0877641677856444,
"memory(GiB)": 79.85,
"step": 895,
"token_acc": 0.5409986257443885,
"train_speed(iter/s)": 0.208519
},
{
"epoch": 0.34668721109399075,
"grad_norm": 0.8776059746742249,
"learning_rate": 0.00012353996494619512,
"loss": 2.134198760986328,
"memory(GiB)": 79.85,
"step": 900,
"token_acc": 0.5481927710843374,
"train_speed(iter/s)": 0.209172
},
{
"epoch": 0.348613251155624,
"grad_norm": 0.6768463253974915,
"learning_rate": 0.00012351131122249274,
"loss": 2.0584712982177735,
"memory(GiB)": 79.85,
"step": 905,
"token_acc": 0.517769130998703,
"train_speed(iter/s)": 0.208188
},
{
"epoch": 0.3505392912172573,
"grad_norm": 0.6463296413421631,
"learning_rate": 0.00012348238244268097,
"loss": 2.142026901245117,
"memory(GiB)": 79.85,
"step": 910,
"token_acc": 0.5444,
"train_speed(iter/s)": 0.208829
},
{
"epoch": 0.3524653312788906,
"grad_norm": 0.7297253012657166,
"learning_rate": 0.0001234531787371789,
"loss": 2.094883346557617,
"memory(GiB)": 79.85,
"step": 915,
"token_acc": 0.5353482260183968,
"train_speed(iter/s)": 0.20826
},
{
"epoch": 0.3543913713405239,
"grad_norm": 1.432271957397461,
"learning_rate": 0.000123423700237645,
"loss": 2.0353137969970705,
"memory(GiB)": 79.85,
"step": 920,
"token_acc": 0.5465734265734266,
"train_speed(iter/s)": 0.208915
},
{
"epoch": 0.35631741140215717,
"grad_norm": 0.49493953585624695,
"learning_rate": 0.00012339394707697665,
"loss": 2.091717529296875,
"memory(GiB)": 79.85,
"step": 925,
"token_acc": 0.5342435586875137,
"train_speed(iter/s)": 0.209559
},
{
"epoch": 0.35824345146379044,
"grad_norm": 0.9767318367958069,
"learning_rate": 0.00012336391938930943,
"loss": 2.0874820709228517,
"memory(GiB)": 79.85,
"step": 930,
"token_acc": 0.5363825363825364,
"train_speed(iter/s)": 0.209431
},
{
"epoch": 0.3601694915254237,
"grad_norm": 0.7268040776252747,
"learning_rate": 0.00012333361731001657,
"loss": 2.15291748046875,
"memory(GiB)": 79.85,
"step": 935,
"token_acc": 0.5481201229605107,
"train_speed(iter/s)": 0.209953
},
{
"epoch": 0.362095531587057,
"grad_norm": 1.4657659530639648,
"learning_rate": 0.00012330304097570838,
"loss": 2.0440414428710936,
"memory(GiB)": 79.85,
"step": 940,
"token_acc": 0.5642281105990783,
"train_speed(iter/s)": 0.209602
},
{
"epoch": 0.3640215716486903,
"grad_norm": 0.7875342965126038,
"learning_rate": 0.0001232721905242315,
"loss": 2.0545331954956056,
"memory(GiB)": 79.85,
"step": 945,
"token_acc": 0.5512609649122807,
"train_speed(iter/s)": 0.210242
},
{
"epoch": 0.3659476117103236,
"grad_norm": 0.846772313117981,
"learning_rate": 0.00012324106609466848,
"loss": 2.015234375,
"memory(GiB)": 79.85,
"step": 950,
"token_acc": 0.5592188688815622,
"train_speed(iter/s)": 0.209286
},
{
"epoch": 0.36787365177195686,
"grad_norm": 0.717317521572113,
"learning_rate": 0.00012320966782733693,
"loss": 2.0592109680175783,
"memory(GiB)": 79.85,
"step": 955,
"token_acc": 0.5464055196973069,
"train_speed(iter/s)": 0.209915
},
{
"epoch": 0.3697996918335901,
"grad_norm": 0.7228723168373108,
"learning_rate": 0.0001231779958637891,
"loss": 2.084528350830078,
"memory(GiB)": 79.85,
"step": 960,
"token_acc": 0.5468301591442735,
"train_speed(iter/s)": 0.210547
},
{
"epoch": 0.3717257318952234,
"grad_norm": 0.9915047287940979,
"learning_rate": 0.00012314605034681103,
"loss": 2.0678550720214846,
"memory(GiB)": 79.85,
"step": 965,
"token_acc": 0.5451188552965612,
"train_speed(iter/s)": 0.210174
},
{
"epoch": 0.3736517719568567,
"grad_norm": 0.8277711272239685,
"learning_rate": 0.00012311383142042212,
"loss": 2.031156539916992,
"memory(GiB)": 79.85,
"step": 970,
"token_acc": 0.5483870967741935,
"train_speed(iter/s)": 0.210654
},
{
"epoch": 0.37557781201849,
"grad_norm": 1.8129619359970093,
"learning_rate": 0.00012308133922987432,
"loss": 2.0359249114990234,
"memory(GiB)": 92.51,
"step": 975,
"token_acc": 0.5392670157068062,
"train_speed(iter/s)": 0.209557
},
{
"epoch": 0.37750385208012327,
"grad_norm": 0.8173950910568237,
"learning_rate": 0.00012304857392165153,
"loss": 2.081368827819824,
"memory(GiB)": 92.51,
"step": 980,
"token_acc": 0.5533149171270718,
"train_speed(iter/s)": 0.210163
},
{
"epoch": 0.37942989214175654,
"grad_norm": 0.8520150780677795,
"learning_rate": 0.00012301553564346895,
"loss": 2.062424087524414,
"memory(GiB)": 92.51,
"step": 985,
"token_acc": 0.571071071071071,
"train_speed(iter/s)": 0.210491
},
{
"epoch": 0.3813559322033898,
"grad_norm": 1.1772634983062744,
"learning_rate": 0.00012298222454427244,
"loss": 1.996800422668457,
"memory(GiB)": 92.51,
"step": 990,
"token_acc": 0.5325443786982249,
"train_speed(iter/s)": 0.20997
},
{
"epoch": 0.3832819722650231,
"grad_norm": 0.8828487396240234,
"learning_rate": 0.00012294864077423774,
"loss": 2.073063278198242,
"memory(GiB)": 92.51,
"step": 995,
"token_acc": 0.5498062457260087,
"train_speed(iter/s)": 0.210097
},
{
"epoch": 0.3852080123266564,
"grad_norm": 2.339871644973755,
"learning_rate": 0.00012291478448476993,
"loss": 2.0193538665771484,
"memory(GiB)": 105.37,
"step": 1000,
"token_acc": 0.5315152609716453,
"train_speed(iter/s)": 0.209688
},
{
"epoch": 0.3871340523882897,
"grad_norm": 0.5021800398826599,
"learning_rate": 0.00012288065582850266,
"loss": 2.0437103271484376,
"memory(GiB)": 105.37,
"step": 1005,
"token_acc": 0.5345794392523364,
"train_speed(iter/s)": 0.210274
},
{
"epoch": 0.38906009244992296,
"grad_norm": 1.310742974281311,
"learning_rate": 0.00012284625495929749,
"loss": 2.1039939880371095,
"memory(GiB)": 105.37,
"step": 1010,
"token_acc": 0.5590607210626186,
"train_speed(iter/s)": 0.209347
},
{
"epoch": 0.39098613251155623,
"grad_norm": 0.8727560639381409,
"learning_rate": 0.00012281158203224316,
"loss": 1.9523155212402343,
"memory(GiB)": 105.37,
"step": 1015,
"token_acc": 0.552047096601552,
"train_speed(iter/s)": 0.209949
},
{
"epoch": 0.3929121725731895,
"grad_norm": 0.7556589841842651,
"learning_rate": 0.000122776637203655,
"loss": 2.044467544555664,
"memory(GiB)": 105.37,
"step": 1020,
"token_acc": 0.5644420426911646,
"train_speed(iter/s)": 0.210211
},
{
"epoch": 0.3948382126348228,
"grad_norm": 1.5188084840774536,
"learning_rate": 0.0001227414206310741,
"loss": 2.046164131164551,
"memory(GiB)": 105.37,
"step": 1025,
"token_acc": 0.5623644251626898,
"train_speed(iter/s)": 0.209087
},
{
"epoch": 0.3967642526964561,
"grad_norm": 0.6403911113739014,
"learning_rate": 0.00012270593247326662,
"loss": 2.028892707824707,
"memory(GiB)": 105.37,
"step": 1030,
"token_acc": 0.5631252977608385,
"train_speed(iter/s)": 0.209665
},
{
"epoch": 0.39869029275808937,
"grad_norm": 0.8856572508811951,
"learning_rate": 0.00012267017289022315,
"loss": 2.013199806213379,
"memory(GiB)": 105.37,
"step": 1035,
"token_acc": 0.5521528897075754,
"train_speed(iter/s)": 0.209096
},
{
"epoch": 0.40061633281972264,
"grad_norm": 1.5891669988632202,
"learning_rate": 0.0001226341420431579,
"loss": 2.0458957672119142,
"memory(GiB)": 105.37,
"step": 1040,
"token_acc": 0.5475583864118896,
"train_speed(iter/s)": 0.209668
},
{
"epoch": 0.4025423728813559,
"grad_norm": 0.733910083770752,
"learning_rate": 0.00012259784009450807,
"loss": 2.070827865600586,
"memory(GiB)": 105.37,
"step": 1045,
"token_acc": 0.5413500223513634,
"train_speed(iter/s)": 0.209886
},
{
"epoch": 0.40446841294298924,
"grad_norm": 1.6674824953079224,
"learning_rate": 0.000122561267207933,
"loss": 2.0968223571777345,
"memory(GiB)": 105.37,
"step": 1050,
"token_acc": 0.5612293144208038,
"train_speed(iter/s)": 0.209802
},
{
"epoch": 0.4063944530046225,
"grad_norm": 3.2688026428222656,
"learning_rate": 0.00012252442354831358,
"loss": 2.0730255126953123,
"memory(GiB)": 105.37,
"step": 1055,
"token_acc": 0.5779054916985952,
"train_speed(iter/s)": 0.209444
},
{
"epoch": 0.4083204930662558,
"grad_norm": 1.2243387699127197,
"learning_rate": 0.0001224873092817513,
"loss": 2.079141616821289,
"memory(GiB)": 105.37,
"step": 1060,
"token_acc": 0.5400244798041616,
"train_speed(iter/s)": 0.209607
},
{
"epoch": 0.41024653312788906,
"grad_norm": 0.8547586798667908,
"learning_rate": 0.0001224499245755677,
"loss": 2.0916282653808596,
"memory(GiB)": 105.37,
"step": 1065,
"token_acc": 0.5481445549357264,
"train_speed(iter/s)": 0.210169
},
{
"epoch": 0.41217257318952233,
"grad_norm": 1.0343953371047974,
"learning_rate": 0.00012241226959830355,
"loss": 2.0095287322998048,
"memory(GiB)": 105.37,
"step": 1070,
"token_acc": 0.561633281972265,
"train_speed(iter/s)": 0.209478
},
{
"epoch": 0.4140986132511556,
"grad_norm": 0.5994991660118103,
"learning_rate": 0.00012237434451971806,
"loss": 2.0404300689697266,
"memory(GiB)": 105.37,
"step": 1075,
"token_acc": 0.5338888888888889,
"train_speed(iter/s)": 0.209944
},
{
"epoch": 0.41602465331278893,
"grad_norm": 0.4578043818473816,
"learning_rate": 0.0001223361495107881,
"loss": 2.0485496520996094,
"memory(GiB)": 105.37,
"step": 1080,
"token_acc": 0.545324085147094,
"train_speed(iter/s)": 0.209655
},
{
"epoch": 0.4179506933744222,
"grad_norm": 0.5585042238235474,
"learning_rate": 0.00012229768474370748,
"loss": 2.0737884521484373,
"memory(GiB)": 105.37,
"step": 1085,
"token_acc": 0.5437039833868227,
"train_speed(iter/s)": 0.210085
},
{
"epoch": 0.41987673343605547,
"grad_norm": 0.711057186126709,
"learning_rate": 0.00012225895039188618,
"loss": 2.0477458953857424,
"memory(GiB)": 105.37,
"step": 1090,
"token_acc": 0.5625491738788355,
"train_speed(iter/s)": 0.210651
},
{
"epoch": 0.42180277349768874,
"grad_norm": 2.2334554195404053,
"learning_rate": 0.00012221994662994952,
"loss": 2.0743385314941407,
"memory(GiB)": 105.37,
"step": 1095,
"token_acc": 0.5573217726396917,
"train_speed(iter/s)": 0.210032
},
{
"epoch": 0.423728813559322,
"grad_norm": 0.5117713809013367,
"learning_rate": 0.00012218067363373739,
"loss": 2.0117897033691405,
"memory(GiB)": 105.37,
"step": 1100,
"token_acc": 0.5353863810252487,
"train_speed(iter/s)": 0.210353
},
{
"epoch": 0.42565485362095534,
"grad_norm": 1.5961309671401978,
"learning_rate": 0.0001221411315803035,
"loss": 1.9560466766357423,
"memory(GiB)": 105.37,
"step": 1105,
"token_acc": 0.5727002967359051,
"train_speed(iter/s)": 0.21031
},
{
"epoch": 0.4275808936825886,
"grad_norm": 0.7415860295295715,
"learning_rate": 0.00012210132064791453,
"loss": 2.0616329193115233,
"memory(GiB)": 105.37,
"step": 1110,
"token_acc": 0.5493295019157088,
"train_speed(iter/s)": 0.210041
},
{
"epoch": 0.4295069337442219,
"grad_norm": 0.7390707731246948,
"learning_rate": 0.00012206124101604929,
"loss": 2.054303741455078,
"memory(GiB)": 105.37,
"step": 1115,
"token_acc": 0.5525114155251142,
"train_speed(iter/s)": 0.20999
},
{
"epoch": 0.43143297380585516,
"grad_norm": 0.5878385305404663,
"learning_rate": 0.00012202089286539803,
"loss": 2.0334293365478517,
"memory(GiB)": 105.37,
"step": 1120,
"token_acc": 0.547119249665029,
"train_speed(iter/s)": 0.209834
},
{
"epoch": 0.43335901386748843,
"grad_norm": 0.7637941837310791,
"learning_rate": 0.00012198027637786155,
"loss": 2.0259563446044924,
"memory(GiB)": 105.37,
"step": 1125,
"token_acc": 0.5531969309462915,
"train_speed(iter/s)": 0.210238
},
{
"epoch": 0.4352850539291217,
"grad_norm": 0.7901144027709961,
"learning_rate": 0.00012193939173655033,
"loss": 2.0190959930419923,
"memory(GiB)": 105.37,
"step": 1130,
"token_acc": 0.5437619961612284,
"train_speed(iter/s)": 0.209714
},
{
"epoch": 0.43721109399075503,
"grad_norm": 0.9945278167724609,
"learning_rate": 0.00012189823912578385,
"loss": 1.9761981964111328,
"memory(GiB)": 105.37,
"step": 1135,
"token_acc": 0.5514848737163475,
"train_speed(iter/s)": 0.210248
},
{
"epoch": 0.4391371340523883,
"grad_norm": 0.6760552525520325,
"learning_rate": 0.00012185681873108962,
"loss": 1.9804224014282226,
"memory(GiB)": 105.37,
"step": 1140,
"token_acc": 0.5512299976116551,
"train_speed(iter/s)": 0.209898
},
{
"epoch": 0.4410631741140216,
"grad_norm": 1.1441941261291504,
"learning_rate": 0.00012181513073920237,
"loss": 2.0174320220947264,
"memory(GiB)": 105.37,
"step": 1145,
"token_acc": 0.555012853470437,
"train_speed(iter/s)": 0.209709
},
{
"epoch": 0.44298921417565484,
"grad_norm": 1.7252224683761597,
"learning_rate": 0.00012177317533806327,
"loss": 2.0251365661621095,
"memory(GiB)": 105.37,
"step": 1150,
"token_acc": 0.544793182290584,
"train_speed(iter/s)": 0.210224
},
{
"epoch": 0.4449152542372881,
"grad_norm": 1.856744408607483,
"learning_rate": 0.00012173095271681905,
"loss": 2.0513368606567384,
"memory(GiB)": 105.37,
"step": 1155,
"token_acc": 0.5461949605497582,
"train_speed(iter/s)": 0.209507
},
{
"epoch": 0.44684129429892144,
"grad_norm": 0.6724086999893188,
"learning_rate": 0.00012168846306582115,
"loss": 2.039206695556641,
"memory(GiB)": 105.37,
"step": 1160,
"token_acc": 0.5597987651497828,
"train_speed(iter/s)": 0.210015
},
{
"epoch": 0.4487673343605547,
"grad_norm": 0.6890406012535095,
"learning_rate": 0.00012164570657662482,
"loss": 2.0192028045654298,
"memory(GiB)": 105.37,
"step": 1165,
"token_acc": 0.5484396200814111,
"train_speed(iter/s)": 0.209598
},
{
"epoch": 0.450693374422188,
"grad_norm": 0.6652777791023254,
"learning_rate": 0.00012160268344198832,
"loss": 1.9650936126708984,
"memory(GiB)": 105.37,
"step": 1170,
"token_acc": 0.537867410426947,
"train_speed(iter/s)": 0.209734
},
{
"epoch": 0.45261941448382126,
"grad_norm": 0.9391166567802429,
"learning_rate": 0.00012155939385587201,
"loss": 2.0331436157226563,
"memory(GiB)": 105.37,
"step": 1175,
"token_acc": 0.5479643056330172,
"train_speed(iter/s)": 0.209284
},
{
"epoch": 0.45454545454545453,
"grad_norm": 0.6270633935928345,
"learning_rate": 0.00012151583801343746,
"loss": 2.079738235473633,
"memory(GiB)": 105.37,
"step": 1180,
"token_acc": 0.5605736301369864,
"train_speed(iter/s)": 0.209321
},
{
"epoch": 0.4564714946070878,
"grad_norm": 1.0157898664474487,
"learning_rate": 0.00012147201611104667,
"loss": 2.0804901123046875,
"memory(GiB)": 105.37,
"step": 1185,
"token_acc": 0.5490492001207365,
"train_speed(iter/s)": 0.209828
},
{
"epoch": 0.45839753466872113,
"grad_norm": 0.6536192893981934,
"learning_rate": 0.00012142792834626104,
"loss": 2.0880712509155273,
"memory(GiB)": 105.37,
"step": 1190,
"token_acc": 0.5626702997275205,
"train_speed(iter/s)": 0.209129
},
{
"epoch": 0.4603235747303544,
"grad_norm": 2.072760581970215,
"learning_rate": 0.0001213835749178406,
"loss": 2.013889503479004,
"memory(GiB)": 105.37,
"step": 1195,
"token_acc": 0.5395019321597252,
"train_speed(iter/s)": 0.209629
},
{
"epoch": 0.4622496147919877,
"grad_norm": 0.7244282364845276,
"learning_rate": 0.00012133895602574308,
"loss": 2.0632280349731444,
"memory(GiB)": 105.37,
"step": 1200,
"token_acc": 0.5461600214075462,
"train_speed(iter/s)": 0.209666
},
{
"epoch": 0.46417565485362094,
"grad_norm": 2.0147016048431396,
"learning_rate": 0.0001212940718711229,
"loss": 2.0078060150146486,
"memory(GiB)": 105.37,
"step": 1205,
"token_acc": 0.5640074211502782,
"train_speed(iter/s)": 0.209231
},
{
"epoch": 0.4661016949152542,
"grad_norm": 1.7751325368881226,
"learning_rate": 0.00012124892265633046,
"loss": 2.0283557891845705,
"memory(GiB)": 105.37,
"step": 1210,
"token_acc": 0.5644631973745898,
"train_speed(iter/s)": 0.209721
},
{
"epoch": 0.46802773497688754,
"grad_norm": 0.8284670114517212,
"learning_rate": 0.00012120350858491108,
"loss": 2.037373733520508,
"memory(GiB)": 105.37,
"step": 1215,
"token_acc": 0.5542967079948696,
"train_speed(iter/s)": 0.209352
},
{
"epoch": 0.4699537750385208,
"grad_norm": 1.220298409461975,
"learning_rate": 0.00012115782986160416,
"loss": 2.0448408126831055,
"memory(GiB)": 105.37,
"step": 1220,
"token_acc": 0.5483870967741935,
"train_speed(iter/s)": 0.209837
},
{
"epoch": 0.4718798151001541,
"grad_norm": 1.0690405368804932,
"learning_rate": 0.00012111188669234216,
"loss": 2.0168430328369142,
"memory(GiB)": 105.37,
"step": 1225,
"token_acc": 0.5540720961281709,
"train_speed(iter/s)": 0.209615
},
{
"epoch": 0.47380585516178736,
"grad_norm": 3.044036626815796,
"learning_rate": 0.00012106567928424981,
"loss": 2.089277458190918,
"memory(GiB)": 105.37,
"step": 1230,
"token_acc": 0.5523988206915036,
"train_speed(iter/s)": 0.209705
},
{
"epoch": 0.47573189522342063,
"grad_norm": 0.8940361738204956,
"learning_rate": 0.00012101920784564306,
"loss": 2.023123931884766,
"memory(GiB)": 105.37,
"step": 1235,
"token_acc": 0.5507856341189674,
"train_speed(iter/s)": 0.209654
},
{
"epoch": 0.4776579352850539,
"grad_norm": 0.9247569441795349,
"learning_rate": 0.00012097247258602819,
"loss": 2.014914321899414,
"memory(GiB)": 105.37,
"step": 1240,
"token_acc": 0.5493201483312732,
"train_speed(iter/s)": 0.209393
},
{
"epoch": 0.47958397534668723,
"grad_norm": 0.6719440221786499,
"learning_rate": 0.00012092547371610085,
"loss": 1.9490089416503906,
"memory(GiB)": 105.37,
"step": 1245,
"token_acc": 0.5732605729877217,
"train_speed(iter/s)": 0.20988
},
{
"epoch": 0.4815100154083205,
"grad_norm": 0.70192950963974,
"learning_rate": 0.00012087821144774518,
"loss": 1.9983936309814454,
"memory(GiB)": 105.37,
"step": 1250,
"token_acc": 0.5967137503603344,
"train_speed(iter/s)": 0.20942
},
{
"epoch": 0.4834360554699538,
"grad_norm": 1.071979284286499,
"learning_rate": 0.00012083068599403269,
"loss": 2.0260143280029297,
"memory(GiB)": 105.37,
"step": 1255,
"token_acc": 0.5576756287944492,
"train_speed(iter/s)": 0.209904
},
{
"epoch": 0.48536209553158705,
"grad_norm": 0.8790524005889893,
"learning_rate": 0.0001207828975692215,
"loss": 1.9632652282714844,
"memory(GiB)": 105.37,
"step": 1260,
"token_acc": 0.5521518987341772,
"train_speed(iter/s)": 0.209838
},
{
"epoch": 0.4872881355932203,
"grad_norm": 1.2352432012557983,
"learning_rate": 0.0001207348463887552,
"loss": 2.0295257568359375,
"memory(GiB)": 105.37,
"step": 1265,
"token_acc": 0.5505913272010512,
"train_speed(iter/s)": 0.209822
},
{
"epoch": 0.48921417565485364,
"grad_norm": 1.1282159090042114,
"learning_rate": 0.00012068653266926205,
"loss": 2.0238704681396484,
"memory(GiB)": 105.37,
"step": 1270,
"token_acc": 0.5539687811358353,
"train_speed(iter/s)": 0.210292
},
{
"epoch": 0.4911402157164869,
"grad_norm": 0.6603449583053589,
"learning_rate": 0.00012063795662855379,
"loss": 2.0347692489624025,
"memory(GiB)": 105.37,
"step": 1275,
"token_acc": 0.5481445549357264,
"train_speed(iter/s)": 0.209939
},
{
"epoch": 0.4930662557781202,
"grad_norm": 0.5944059491157532,
"learning_rate": 0.00012058911848562488,
"loss": 2.025372314453125,
"memory(GiB)": 105.37,
"step": 1280,
"token_acc": 0.5380639097744361,
"train_speed(iter/s)": 0.210292
},
{
"epoch": 0.49499229583975346,
"grad_norm": 0.7217702865600586,
"learning_rate": 0.00012054001846065136,
"loss": 2.023514747619629,
"memory(GiB)": 105.37,
"step": 1285,
"token_acc": 0.5491269220745374,
"train_speed(iter/s)": 0.210254
},
{
"epoch": 0.49691833590138673,
"grad_norm": 0.8489204049110413,
"learning_rate": 0.00012049065677498994,
"loss": 1.959089469909668,
"memory(GiB)": 105.37,
"step": 1290,
"token_acc": 0.5679075738125803,
"train_speed(iter/s)": 0.210134
},
{
"epoch": 0.49884437596302,
"grad_norm": 0.8508457541465759,
"learning_rate": 0.00012044103365117689,
"loss": 1.9402631759643554,
"memory(GiB)": 105.37,
"step": 1295,
"token_acc": 0.5967606813739179,
"train_speed(iter/s)": 0.209897
},
{
"epoch": 0.5007704160246533,
"grad_norm": 0.7315754294395447,
"learning_rate": 0.00012039114931292725,
"loss": 2.0376415252685547,
"memory(GiB)": 105.37,
"step": 1300,
"token_acc": 0.5633968478005176,
"train_speed(iter/s)": 0.210351
},
{
"epoch": 0.5026964560862865,
"grad_norm": 0.4978732168674469,
"learning_rate": 0.00012034100398513356,
"loss": 1.9862529754638671,
"memory(GiB)": 105.37,
"step": 1305,
"token_acc": 0.5464994775339603,
"train_speed(iter/s)": 0.21037
},
{
"epoch": 0.5046224961479199,
"grad_norm": 0.7517293095588684,
"learning_rate": 0.00012029059789386503,
"loss": 1.9807701110839844,
"memory(GiB)": 105.37,
"step": 1310,
"token_acc": 0.5634867689570825,
"train_speed(iter/s)": 0.210447
},
{
"epoch": 0.5065485362095532,
"grad_norm": 2.2905900478363037,
"learning_rate": 0.00012023993126636651,
"loss": 2.0183515548706055,
"memory(GiB)": 105.37,
"step": 1315,
"token_acc": 0.5445933456561922,
"train_speed(iter/s)": 0.210508
},
{
"epoch": 0.5084745762711864,
"grad_norm": 0.9722186326980591,
"learning_rate": 0.0001201890043310573,
"loss": 1.9719818115234375,
"memory(GiB)": 105.37,
"step": 1320,
"token_acc": 0.5350995938889963,
"train_speed(iter/s)": 0.210529
},
{
"epoch": 0.5104006163328197,
"grad_norm": 0.57307368516922,
"learning_rate": 0.00012013781731753039,
"loss": 2.02282829284668,
"memory(GiB)": 105.37,
"step": 1325,
"token_acc": 0.5638364127050031,
"train_speed(iter/s)": 0.210976
},
{
"epoch": 0.512326656394453,
"grad_norm": 0.6921036243438721,
"learning_rate": 0.00012008637045655114,
"loss": 1.9853046417236329,
"memory(GiB)": 105.37,
"step": 1330,
"token_acc": 0.5558528428093645,
"train_speed(iter/s)": 0.210909
},
{
"epoch": 0.5142526964560863,
"grad_norm": 0.7683034539222717,
"learning_rate": 0.00012003466398005647,
"loss": 1.942391586303711,
"memory(GiB)": 105.37,
"step": 1335,
"token_acc": 0.5475708502024291,
"train_speed(iter/s)": 0.210705
},
{
"epoch": 0.5161787365177196,
"grad_norm": 0.990985631942749,
"learning_rate": 0.00011998269812115366,
"loss": 2.008869171142578,
"memory(GiB)": 105.37,
"step": 1340,
"token_acc": 0.5429460580912863,
"train_speed(iter/s)": 0.210751
},
{
"epoch": 0.5181047765793528,
"grad_norm": 1.4317958354949951,
"learning_rate": 0.00011993047311411939,
"loss": 2.0736225128173826,
"memory(GiB)": 105.37,
"step": 1345,
"token_acc": 0.5566418703506908,
"train_speed(iter/s)": 0.210625
},
{
"epoch": 0.5200308166409862,
"grad_norm": 0.6179465651512146,
"learning_rate": 0.00011987798919439865,
"loss": 1.9483587265014648,
"memory(GiB)": 105.37,
"step": 1350,
"token_acc": 0.5767310614282614,
"train_speed(iter/s)": 0.210382
},
{
"epoch": 0.5219568567026194,
"grad_norm": 0.6897500157356262,
"learning_rate": 0.00011982524659860366,
"loss": 1.959177589416504,
"memory(GiB)": 105.37,
"step": 1355,
"token_acc": 0.5470760894107022,
"train_speed(iter/s)": 0.210364
},
{
"epoch": 0.5238828967642527,
"grad_norm": 1.302018642425537,
"learning_rate": 0.00011977224556451289,
"loss": 2.018106460571289,
"memory(GiB)": 105.37,
"step": 1360,
"token_acc": 0.5561760107214653,
"train_speed(iter/s)": 0.210806
},
{
"epoch": 0.525808936825886,
"grad_norm": 0.897825300693512,
"learning_rate": 0.00011971898633106979,
"loss": 1.971597671508789,
"memory(GiB)": 105.37,
"step": 1365,
"token_acc": 0.5543684710351378,
"train_speed(iter/s)": 0.210405
},
{
"epoch": 0.5277349768875192,
"grad_norm": 0.8042570352554321,
"learning_rate": 0.000119665469138382,
"loss": 1.9955223083496094,
"memory(GiB)": 105.37,
"step": 1370,
"token_acc": 0.5700998185117967,
"train_speed(iter/s)": 0.210695
},
{
"epoch": 0.5296610169491526,
"grad_norm": 0.6321896910667419,
"learning_rate": 0.00011961169422772,
"loss": 1.998664093017578,
"memory(GiB)": 105.37,
"step": 1375,
"token_acc": 0.5600081366965012,
"train_speed(iter/s)": 0.210262
},
{
"epoch": 0.5315870570107858,
"grad_norm": 0.8121838569641113,
"learning_rate": 0.0001195576618415162,
"loss": 1.9670547485351562,
"memory(GiB)": 105.37,
"step": 1380,
"token_acc": 0.5784518828451883,
"train_speed(iter/s)": 0.210294
},
{
"epoch": 0.5335130970724191,
"grad_norm": 0.7805467247962952,
"learning_rate": 0.00011950337222336374,
"loss": 2.026367950439453,
"memory(GiB)": 105.37,
"step": 1385,
"token_acc": 0.5629067245119306,
"train_speed(iter/s)": 0.210719
},
{
"epoch": 0.5354391371340523,
"grad_norm": 0.6697444915771484,
"learning_rate": 0.00011944882561801545,
"loss": 2.056959533691406,
"memory(GiB)": 105.37,
"step": 1390,
"token_acc": 0.5635869565217392,
"train_speed(iter/s)": 0.210364
},
{
"epoch": 0.5373651771956857,
"grad_norm": 0.5845000743865967,
"learning_rate": 0.00011939402227138275,
"loss": 1.9832889556884765,
"memory(GiB)": 105.37,
"step": 1395,
"token_acc": 0.5597981127935044,
"train_speed(iter/s)": 0.210801
},
{
"epoch": 0.539291217257319,
"grad_norm": 0.7413605451583862,
"learning_rate": 0.0001193389624305345,
"loss": 1.9535972595214843,
"memory(GiB)": 105.37,
"step": 1400,
"token_acc": 0.5776587605202754,
"train_speed(iter/s)": 0.210204
},
{
"epoch": 0.5412172573189522,
"grad_norm": 0.7914743423461914,
"learning_rate": 0.00011928364634369587,
"loss": 1.9574665069580077,
"memory(GiB)": 105.37,
"step": 1405,
"token_acc": 0.5467493682517803,
"train_speed(iter/s)": 0.210619
},
{
"epoch": 0.5431432973805855,
"grad_norm": 0.7502923607826233,
"learning_rate": 0.00011922807426024737,
"loss": 1.9930837631225586,
"memory(GiB)": 105.37,
"step": 1410,
"token_acc": 0.557456034690436,
"train_speed(iter/s)": 0.210322
},
{
"epoch": 0.5450693374422187,
"grad_norm": 1.183559536933899,
"learning_rate": 0.00011917224643072349,
"loss": 2.017503356933594,
"memory(GiB)": 105.37,
"step": 1415,
"token_acc": 0.5502546234253551,
"train_speed(iter/s)": 0.210705
},
{
"epoch": 0.5469953775038521,
"grad_norm": 0.7133117914199829,
"learning_rate": 0.00011911616310681175,
"loss": 1.999475860595703,
"memory(GiB)": 105.37,
"step": 1420,
"token_acc": 0.5499178307313065,
"train_speed(iter/s)": 0.211131
},
{
"epoch": 0.5489214175654854,
"grad_norm": 0.9616044163703918,
"learning_rate": 0.00011905982454135156,
"loss": 1.9801986694335938,
"memory(GiB)": 105.37,
"step": 1425,
"token_acc": 0.5656905934179839,
"train_speed(iter/s)": 0.210607
},
{
"epoch": 0.5508474576271186,
"grad_norm": 0.8774197697639465,
"learning_rate": 0.00011900323098833292,
"loss": 2.008523941040039,
"memory(GiB)": 105.37,
"step": 1430,
"token_acc": 0.5603057081442561,
"train_speed(iter/s)": 0.210986
},
{
"epoch": 0.552773497688752,
"grad_norm": 1.7564359903335571,
"learning_rate": 0.00011894638270289548,
"loss": 2.0222816467285156,
"memory(GiB)": 105.37,
"step": 1435,
"token_acc": 0.5521039876624807,
"train_speed(iter/s)": 0.210573
},
{
"epoch": 0.5546995377503852,
"grad_norm": 0.7343314290046692,
"learning_rate": 0.00011888927994132726,
"loss": 2.0308483123779295,
"memory(GiB)": 105.37,
"step": 1440,
"token_acc": 0.543450722067393,
"train_speed(iter/s)": 0.210983
},
{
"epoch": 0.5566255778120185,
"grad_norm": 0.7535374760627747,
"learning_rate": 0.00011883192296106352,
"loss": 1.9528327941894532,
"memory(GiB)": 105.37,
"step": 1445,
"token_acc": 0.572887247447317,
"train_speed(iter/s)": 0.2114
},
{
"epoch": 0.5585516178736518,
"grad_norm": 0.8439003229141235,
"learning_rate": 0.00011877431202068561,
"loss": 2.0099605560302733,
"memory(GiB)": 105.37,
"step": 1450,
"token_acc": 0.5727204220045214,
"train_speed(iter/s)": 0.21098
},
{
"epoch": 0.560477657935285,
"grad_norm": 1.056840181350708,
"learning_rate": 0.00011871644737991985,
"loss": 1.9874114990234375,
"memory(GiB)": 105.37,
"step": 1455,
"token_acc": 0.5524736079486648,
"train_speed(iter/s)": 0.211386
},
{
"epoch": 0.5624036979969184,
"grad_norm": 1.0296924114227295,
"learning_rate": 0.00011865832929963624,
"loss": 2.0156904220581056,
"memory(GiB)": 105.37,
"step": 1460,
"token_acc": 0.5577239595579591,
"train_speed(iter/s)": 0.21065
},
{
"epoch": 0.5643297380585516,
"grad_norm": 0.975055456161499,
"learning_rate": 0.00011859995804184743,
"loss": 1.9642263412475587,
"memory(GiB)": 105.37,
"step": 1465,
"token_acc": 0.5493017350825222,
"train_speed(iter/s)": 0.211055
},
{
"epoch": 0.5662557781201849,
"grad_norm": 1.1791462898254395,
"learning_rate": 0.00011854133386970738,
"loss": 2.006403160095215,
"memory(GiB)": 105.37,
"step": 1470,
"token_acc": 0.5592257521565327,
"train_speed(iter/s)": 0.210611
},
{
"epoch": 0.5681818181818182,
"grad_norm": 1.0619311332702637,
"learning_rate": 0.00011848245704751035,
"loss": 2.007827377319336,
"memory(GiB)": 105.37,
"step": 1475,
"token_acc": 0.5743907652843095,
"train_speed(iter/s)": 0.211015
},
{
"epoch": 0.5701078582434514,
"grad_norm": 1.6089444160461426,
"learning_rate": 0.00011842332784068953,
"loss": 1.9360605239868165,
"memory(GiB)": 105.37,
"step": 1480,
"token_acc": 0.5758738277919864,
"train_speed(iter/s)": 0.211426
},
{
"epoch": 0.5720338983050848,
"grad_norm": 1.0532867908477783,
"learning_rate": 0.00011836394651581602,
"loss": 2.035934066772461,
"memory(GiB)": 105.37,
"step": 1485,
"token_acc": 0.5557446808510639,
"train_speed(iter/s)": 0.211122
},
{
"epoch": 0.573959938366718,
"grad_norm": 0.956579864025116,
"learning_rate": 0.00011830431334059746,
"loss": 1.949314498901367,
"memory(GiB)": 105.37,
"step": 1490,
"token_acc": 0.5711733174508636,
"train_speed(iter/s)": 0.211522
},
{
"epoch": 0.5758859784283513,
"grad_norm": 1.277976632118225,
"learning_rate": 0.00011824442858387697,
"loss": 1.9759077072143554,
"memory(GiB)": 105.37,
"step": 1495,
"token_acc": 0.5708984892658362,
"train_speed(iter/s)": 0.210946
},
{
"epoch": 0.5778120184899846,
"grad_norm": 0.6209989786148071,
"learning_rate": 0.00011818429251563179,
"loss": 1.9580814361572265,
"memory(GiB)": 105.37,
"step": 1500,
"token_acc": 0.568087318087318,
"train_speed(iter/s)": 0.211338
},
{
"epoch": 0.5797380585516179,
"grad_norm": 0.683822751045227,
"learning_rate": 0.00011812390540697221,
"loss": 1.9568645477294921,
"memory(GiB)": 105.37,
"step": 1505,
"token_acc": 0.565050202948088,
"train_speed(iter/s)": 0.211731
},
{
"epoch": 0.5816640986132512,
"grad_norm": 0.5764166712760925,
"learning_rate": 0.00011806326753014028,
"loss": 1.9968948364257812,
"memory(GiB)": 105.37,
"step": 1510,
"token_acc": 0.553347280334728,
"train_speed(iter/s)": 0.210873
},
{
"epoch": 0.5835901386748844,
"grad_norm": 1.346110463142395,
"learning_rate": 0.00011800237915850853,
"loss": 2.002476692199707,
"memory(GiB)": 105.37,
"step": 1515,
"token_acc": 0.5652956298200514,
"train_speed(iter/s)": 0.211271
},
{
"epoch": 0.5855161787365177,
"grad_norm": 0.9975059628486633,
"learning_rate": 0.00011794124056657885,
"loss": 2.0218505859375,
"memory(GiB)": 105.37,
"step": 1520,
"token_acc": 0.5728085003622313,
"train_speed(iter/s)": 0.21068
},
{
"epoch": 0.587442218798151,
"grad_norm": 0.7744547724723816,
"learning_rate": 0.00011787985202998116,
"loss": 1.9930866241455079,
"memory(GiB)": 105.37,
"step": 1525,
"token_acc": 0.5750998003992016,
"train_speed(iter/s)": 0.211079
},
{
"epoch": 0.5893682588597843,
"grad_norm": 1.1613783836364746,
"learning_rate": 0.00011781821382547218,
"loss": 1.9389902114868165,
"memory(GiB)": 105.37,
"step": 1530,
"token_acc": 0.5658355656295075,
"train_speed(iter/s)": 0.210505
},
{
"epoch": 0.5912942989214176,
"grad_norm": 0.9583060145378113,
"learning_rate": 0.00011775632623093426,
"loss": 2.0099815368652343,
"memory(GiB)": 105.37,
"step": 1535,
"token_acc": 0.5403657448706513,
"train_speed(iter/s)": 0.2109
},
{
"epoch": 0.5932203389830508,
"grad_norm": 0.7002604603767395,
"learning_rate": 0.00011769418952537405,
"loss": 1.961953353881836,
"memory(GiB)": 105.37,
"step": 1540,
"token_acc": 0.5613072519083969,
"train_speed(iter/s)": 0.211295
},
{
"epoch": 0.5951463790446841,
"grad_norm": 1.1121183633804321,
"learning_rate": 0.0001176318039889212,
"loss": 1.9862863540649414,
"memory(GiB)": 105.37,
"step": 1545,
"token_acc": 0.5690152451586321,
"train_speed(iter/s)": 0.210863
},
{
"epoch": 0.5970724191063174,
"grad_norm": 0.6767920851707458,
"learning_rate": 0.00011756916990282729,
"loss": 1.979568099975586,
"memory(GiB)": 105.37,
"step": 1550,
"token_acc": 0.5642661804922516,
"train_speed(iter/s)": 0.211253
},
{
"epoch": 0.5989984591679507,
"grad_norm": 0.6760869026184082,
"learning_rate": 0.00011750628754946427,
"loss": 1.9564386367797852,
"memory(GiB)": 105.37,
"step": 1555,
"token_acc": 0.5620265151515151,
"train_speed(iter/s)": 0.211151
},
{
"epoch": 0.600924499229584,
"grad_norm": 1.6391392946243286,
"learning_rate": 0.00011744315721232349,
"loss": 2.009170722961426,
"memory(GiB)": 105.37,
"step": 1560,
"token_acc": 0.5419106881405563,
"train_speed(iter/s)": 0.211544
},
{
"epoch": 0.6028505392912172,
"grad_norm": 1.3147695064544678,
"learning_rate": 0.00011737977917601421,
"loss": 1.9488815307617187,
"memory(GiB)": 105.37,
"step": 1565,
"token_acc": 0.5393518518518519,
"train_speed(iter/s)": 0.211935
},
{
"epoch": 0.6047765793528506,
"grad_norm": 2.515930414199829,
"learning_rate": 0.00011731615372626239,
"loss": 1.9827709197998047,
"memory(GiB)": 105.37,
"step": 1570,
"token_acc": 0.5508474576271186,
"train_speed(iter/s)": 0.21124
},
{
"epoch": 0.6067026194144838,
"grad_norm": 0.8269686698913574,
"learning_rate": 0.00011725228114990942,
"loss": 1.9226755142211913,
"memory(GiB)": 105.37,
"step": 1575,
"token_acc": 0.553125,
"train_speed(iter/s)": 0.211621
},
{
"epoch": 0.6086286594761171,
"grad_norm": 4.683406829833984,
"learning_rate": 0.00011718816173491079,
"loss": 1.9892017364501953,
"memory(GiB)": 105.37,
"step": 1580,
"token_acc": 0.5648576295935751,
"train_speed(iter/s)": 0.211337
},
{
"epoch": 0.6105546995377504,
"grad_norm": 0.6101524829864502,
"learning_rate": 0.0001171237957703348,
"loss": 1.9213462829589845,
"memory(GiB)": 105.37,
"step": 1585,
"token_acc": 0.5619000738370662,
"train_speed(iter/s)": 0.211404
},
{
"epoch": 0.6124807395993837,
"grad_norm": 0.8342775702476501,
"learning_rate": 0.0001170591835463613,
"loss": 1.9830745697021483,
"memory(GiB)": 105.37,
"step": 1590,
"token_acc": 0.5802612481857765,
"train_speed(iter/s)": 0.211363
},
{
"epoch": 0.614406779661017,
"grad_norm": 1.2638617753982544,
"learning_rate": 0.00011699432535428034,
"loss": 1.9660453796386719,
"memory(GiB)": 105.37,
"step": 1595,
"token_acc": 0.5574653137295507,
"train_speed(iter/s)": 0.211158
},
{
"epoch": 0.6163328197226502,
"grad_norm": 0.8382625579833984,
"learning_rate": 0.0001169292214864908,
"loss": 1.953329086303711,
"memory(GiB)": 105.37,
"step": 1600,
"token_acc": 0.5601037763044104,
"train_speed(iter/s)": 0.211541
},
{
"epoch": 0.6182588597842835,
"grad_norm": 0.7331746816635132,
"learning_rate": 0.00011686387223649921,
"loss": 1.951005744934082,
"memory(GiB)": 105.37,
"step": 1605,
"token_acc": 0.5684530774631407,
"train_speed(iter/s)": 0.21192
},
{
"epoch": 0.6201848998459168,
"grad_norm": 0.7785165905952454,
"learning_rate": 0.0001167982778989183,
"loss": 2.0063850402832033,
"memory(GiB)": 105.37,
"step": 1610,
"token_acc": 0.5563857109502685,
"train_speed(iter/s)": 0.211114
},
{
"epoch": 0.6221109399075501,
"grad_norm": 1.3581520318984985,
"learning_rate": 0.0001167324387694658,
"loss": 1.9742725372314454,
"memory(GiB)": 105.37,
"step": 1615,
"token_acc": 0.5531161473087819,
"train_speed(iter/s)": 0.211476
},
{
"epoch": 0.6240369799691834,
"grad_norm": 0.93679279088974,
"learning_rate": 0.00011666635514496293,
"loss": 1.9857772827148437,
"memory(GiB)": 105.37,
"step": 1620,
"token_acc": 0.5602997955939132,
"train_speed(iter/s)": 0.211022
},
{
"epoch": 0.6259630200308166,
"grad_norm": 3.6678130626678467,
"learning_rate": 0.00011660002732333324,
"loss": 1.8675865173339843,
"memory(GiB)": 105.37,
"step": 1625,
"token_acc": 0.5812195121951219,
"train_speed(iter/s)": 0.211395
},
{
"epoch": 0.6278890600924499,
"grad_norm": 0.9907599687576294,
"learning_rate": 0.00011653345560360116,
"loss": 1.9520898818969727,
"memory(GiB)": 105.37,
"step": 1630,
"token_acc": 0.5672423830778187,
"train_speed(iter/s)": 0.211755
},
{
"epoch": 0.6298151001540832,
"grad_norm": 3.788294553756714,
"learning_rate": 0.00011646664028589062,
"loss": 1.9705934524536133,
"memory(GiB)": 105.37,
"step": 1635,
"token_acc": 0.5625909752547307,
"train_speed(iter/s)": 0.211495
},
{
"epoch": 0.6317411402157165,
"grad_norm": 2.0680153369903564,
"learning_rate": 0.00011639958167142393,
"loss": 1.9400318145751954,
"memory(GiB)": 105.37,
"step": 1640,
"token_acc": 0.5583639705882353,
"train_speed(iter/s)": 0.211853
},
{
"epoch": 0.6336671802773498,
"grad_norm": 1.4715518951416016,
"learning_rate": 0.00011633228006252003,
"loss": 2.005782890319824,
"memory(GiB)": 105.37,
"step": 1645,
"token_acc": 0.5499254843517138,
"train_speed(iter/s)": 0.211605
},
{
"epoch": 0.635593220338983,
"grad_norm": 0.8797225952148438,
"learning_rate": 0.00011626473576259352,
"loss": 1.9657068252563477,
"memory(GiB)": 105.37,
"step": 1650,
"token_acc": 0.5540720961281709,
"train_speed(iter/s)": 0.211752
},
{
"epoch": 0.6375192604006163,
"grad_norm": 0.9937166571617126,
"learning_rate": 0.00011619694907615306,
"loss": 2.0197063446044923,
"memory(GiB)": 105.37,
"step": 1655,
"token_acc": 0.5500343485230135,
"train_speed(iter/s)": 0.211583
},
{
"epoch": 0.6394453004622496,
"grad_norm": 1.6290827989578247,
"learning_rate": 0.0001161289203088,
"loss": 1.9664806365966796,
"memory(GiB)": 105.37,
"step": 1660,
"token_acc": 0.5611902766135792,
"train_speed(iter/s)": 0.21194
},
{
"epoch": 0.6413713405238829,
"grad_norm": 1.0984126329421997,
"learning_rate": 0.00011606064976722716,
"loss": 1.8735197067260743,
"memory(GiB)": 105.37,
"step": 1665,
"token_acc": 0.55747738158595,
"train_speed(iter/s)": 0.211974
},
{
"epoch": 0.6432973805855162,
"grad_norm": 1.7317132949829102,
"learning_rate": 0.00011599213775921727,
"loss": 1.9549205780029297,
"memory(GiB)": 105.37,
"step": 1670,
"token_acc": 0.5516175561508345,
"train_speed(iter/s)": 0.212033
},
{
"epoch": 0.6452234206471494,
"grad_norm": 0.7286852598190308,
"learning_rate": 0.00011592338459364169,
"loss": 1.9672489166259766,
"memory(GiB)": 105.37,
"step": 1675,
"token_acc": 0.5603715170278638,
"train_speed(iter/s)": 0.211845
},
{
"epoch": 0.6471494607087828,
"grad_norm": 1.5284219980239868,
"learning_rate": 0.00011585439058045899,
"loss": 1.9658515930175782,
"memory(GiB)": 105.37,
"step": 1680,
"token_acc": 0.5352622061482821,
"train_speed(iter/s)": 0.21203
},
{
"epoch": 0.649075500770416,
"grad_norm": 0.8596996665000916,
"learning_rate": 0.00011578515603071351,
"loss": 2.0247236251831056,
"memory(GiB)": 105.37,
"step": 1685,
"token_acc": 0.553953488372093,
"train_speed(iter/s)": 0.212382
},
{
"epoch": 0.6510015408320493,
"grad_norm": 0.961242139339447,
"learning_rate": 0.0001157156812565341,
"loss": 1.9505401611328126,
"memory(GiB)": 105.37,
"step": 1690,
"token_acc": 0.5696594427244582,
"train_speed(iter/s)": 0.212116
},
{
"epoch": 0.6529275808936826,
"grad_norm": 0.9511796236038208,
"learning_rate": 0.00011564596657113244,
"loss": 1.9510066986083985,
"memory(GiB)": 105.37,
"step": 1695,
"token_acc": 0.5694721825962911,
"train_speed(iter/s)": 0.212262
},
{
"epoch": 0.6548536209553159,
"grad_norm": 0.7844828367233276,
"learning_rate": 0.00011557601228880197,
"loss": 1.9544694900512696,
"memory(GiB)": 105.37,
"step": 1700,
"token_acc": 0.5549969837120451,
"train_speed(iter/s)": 0.21194
},
{
"epoch": 0.6567796610169492,
"grad_norm": 0.8266842365264893,
"learning_rate": 0.00011550581872491616,
"loss": 1.987652587890625,
"memory(GiB)": 105.37,
"step": 1705,
"token_acc": 0.5577815783044222,
"train_speed(iter/s)": 0.212133
},
{
"epoch": 0.6587057010785824,
"grad_norm": 2.105344533920288,
"learning_rate": 0.00011543538619592734,
"loss": 1.9719772338867188,
"memory(GiB)": 105.37,
"step": 1710,
"token_acc": 0.5512418615866892,
"train_speed(iter/s)": 0.212208
},
{
"epoch": 0.6606317411402157,
"grad_norm": 0.9168369174003601,
"learning_rate": 0.00011536471501936508,
"loss": 1.991562843322754,
"memory(GiB)": 105.37,
"step": 1715,
"token_acc": 0.5696920583468396,
"train_speed(iter/s)": 0.21211
},
{
"epoch": 0.662557781201849,
"grad_norm": 1.1968766450881958,
"learning_rate": 0.0001152938055138349,
"loss": 1.9249608993530274,
"memory(GiB)": 105.37,
"step": 1720,
"token_acc": 0.5806552262090484,
"train_speed(iter/s)": 0.212463
},
{
"epoch": 0.6644838212634823,
"grad_norm": 1.224352240562439,
"learning_rate": 0.00011522265799901671,
"loss": 1.9515010833740234,
"memory(GiB)": 105.37,
"step": 1725,
"token_acc": 0.560291519434629,
"train_speed(iter/s)": 0.212644
},
{
"epoch": 0.6664098613251156,
"grad_norm": 0.9242827892303467,
"learning_rate": 0.00011515127279566351,
"loss": 1.945500373840332,
"memory(GiB)": 105.37,
"step": 1730,
"token_acc": 0.5604420907207,
"train_speed(iter/s)": 0.212406
},
{
"epoch": 0.6683359013867488,
"grad_norm": 0.9901937246322632,
"learning_rate": 0.00011507965022559979,
"loss": 1.950948143005371,
"memory(GiB)": 105.37,
"step": 1735,
"token_acc": 0.549146110056926,
"train_speed(iter/s)": 0.212583
},
{
"epoch": 0.6702619414483821,
"grad_norm": 0.8866608142852783,
"learning_rate": 0.00011500779061172023,
"loss": 1.9757640838623047,
"memory(GiB)": 105.37,
"step": 1740,
"token_acc": 0.5787269681742043,
"train_speed(iter/s)": 0.212321
},
{
"epoch": 0.6721879815100154,
"grad_norm": 1.0115567445755005,
"learning_rate": 0.00011493569427798808,
"loss": 1.9596431732177735,
"memory(GiB)": 105.37,
"step": 1745,
"token_acc": 0.5777520278099653,
"train_speed(iter/s)": 0.212435
},
{
"epoch": 0.6741140215716487,
"grad_norm": 1.4893888235092163,
"learning_rate": 0.00011486336154943389,
"loss": 1.9281715393066405,
"memory(GiB)": 105.37,
"step": 1750,
"token_acc": 0.556639796351294,
"train_speed(iter/s)": 0.212653
},
{
"epoch": 0.676040061633282,
"grad_norm": 4.177835464477539,
"learning_rate": 0.00011479079275215387,
"loss": 1.9544342041015625,
"memory(GiB)": 105.37,
"step": 1755,
"token_acc": 0.5617792421746294,
"train_speed(iter/s)": 0.212439
},
{
"epoch": 0.6779661016949152,
"grad_norm": 1.4126033782958984,
"learning_rate": 0.00011471798821330853,
"loss": 1.9356151580810548,
"memory(GiB)": 105.37,
"step": 1760,
"token_acc": 0.5651345558466302,
"train_speed(iter/s)": 0.212543
},
{
"epoch": 0.6798921417565486,
"grad_norm": 1.016875982284546,
"learning_rate": 0.00011464494826112115,
"loss": 1.8886493682861327,
"memory(GiB)": 105.37,
"step": 1765,
"token_acc": 0.5927835051546392,
"train_speed(iter/s)": 0.212231
},
{
"epoch": 0.6818181818181818,
"grad_norm": 1.1616668701171875,
"learning_rate": 0.00011457167322487633,
"loss": 1.9562149047851562,
"memory(GiB)": 105.37,
"step": 1770,
"token_acc": 0.5639546858908342,
"train_speed(iter/s)": 0.212103
},
{
"epoch": 0.6837442218798151,
"grad_norm": 1.2536641359329224,
"learning_rate": 0.0001144981634349185,
"loss": 1.9360809326171875,
"memory(GiB)": 105.37,
"step": 1775,
"token_acc": 0.5799671592775041,
"train_speed(iter/s)": 0.212159
},
{
"epoch": 0.6856702619414484,
"grad_norm": 0.7041999101638794,
"learning_rate": 0.0001144244192226504,
"loss": 1.9445245742797852,
"memory(GiB)": 105.37,
"step": 1780,
"token_acc": 0.5462128043282236,
"train_speed(iter/s)": 0.212495
},
{
"epoch": 0.6875963020030816,
"grad_norm": 0.8610641360282898,
"learning_rate": 0.00011435044092053165,
"loss": 1.9702924728393554,
"memory(GiB)": 105.37,
"step": 1785,
"token_acc": 0.563499245852187,
"train_speed(iter/s)": 0.212805
},
{
"epoch": 0.689522342064715,
"grad_norm": 0.6737650036811829,
"learning_rate": 0.00011427622886207719,
"loss": 1.915751075744629,
"memory(GiB)": 105.37,
"step": 1790,
"token_acc": 0.5678795483061481,
"train_speed(iter/s)": 0.212328
},
{
"epoch": 0.6914483821263482,
"grad_norm": 0.7427929043769836,
"learning_rate": 0.00011420178338185578,
"loss": 2.0041549682617186,
"memory(GiB)": 105.37,
"step": 1795,
"token_acc": 0.5318739475583354,
"train_speed(iter/s)": 0.212596
},
{
"epoch": 0.6933744221879815,
"grad_norm": 0.7349951863288879,
"learning_rate": 0.00011412710481548855,
"loss": 1.9224048614501954,
"memory(GiB)": 105.37,
"step": 1800,
"token_acc": 0.5747244296334273,
"train_speed(iter/s)": 0.212287
},
{
"epoch": 0.6953004622496148,
"grad_norm": 0.7216867804527283,
"learning_rate": 0.00011405219349964744,
"loss": 1.9310737609863282,
"memory(GiB)": 105.37,
"step": 1805,
"token_acc": 0.5662983425414365,
"train_speed(iter/s)": 0.212618
},
{
"epoch": 0.697226502311248,
"grad_norm": 1.2759655714035034,
"learning_rate": 0.00011397704977205368,
"loss": 1.981161117553711,
"memory(GiB)": 105.37,
"step": 1810,
"token_acc": 0.5637583892617449,
"train_speed(iter/s)": 0.212912
},
{
"epoch": 0.6991525423728814,
"grad_norm": 0.7700905203819275,
"learning_rate": 0.00011390167397147625,
"loss": 1.9500804901123048,
"memory(GiB)": 105.37,
"step": 1815,
"token_acc": 0.569050832208727,
"train_speed(iter/s)": 0.21275
},
{
"epoch": 0.7010785824345146,
"grad_norm": 1.0271632671356201,
"learning_rate": 0.00011382606643773042,
"loss": 1.8470108032226562,
"memory(GiB)": 105.37,
"step": 1820,
"token_acc": 0.5817095349441413,
"train_speed(iter/s)": 0.212627
},
{
"epoch": 0.7030046224961479,
"grad_norm": 1.4572709798812866,
"learning_rate": 0.00011375022751167618,
"loss": 1.9281013488769532,
"memory(GiB)": 105.37,
"step": 1825,
"token_acc": 0.5912471395881007,
"train_speed(iter/s)": 0.212534
},
{
"epoch": 0.7049306625577813,
"grad_norm": 0.8261297941207886,
"learning_rate": 0.00011367415753521668,
"loss": 1.923367691040039,
"memory(GiB)": 105.37,
"step": 1830,
"token_acc": 0.566397487662629,
"train_speed(iter/s)": 0.21255
},
{
"epoch": 0.7068567026194145,
"grad_norm": 0.931074321269989,
"learning_rate": 0.00011359785685129669,
"loss": 1.9254417419433594,
"memory(GiB)": 105.37,
"step": 1835,
"token_acc": 0.5726230291447683,
"train_speed(iter/s)": 0.211973
},
{
"epoch": 0.7087827426810478,
"grad_norm": 1.3759779930114746,
"learning_rate": 0.00011352132580390116,
"loss": 1.9928672790527344,
"memory(GiB)": 105.37,
"step": 1840,
"token_acc": 0.5512025787255145,
"train_speed(iter/s)": 0.212293
},
{
"epoch": 0.710708782742681,
"grad_norm": 0.9524219036102295,
"learning_rate": 0.00011344456473805347,
"loss": 1.968313217163086,
"memory(GiB)": 105.37,
"step": 1845,
"token_acc": 0.5519356075124568,
"train_speed(iter/s)": 0.21254
},
{
"epoch": 0.7126348228043143,
"grad_norm": 1.4314206838607788,
"learning_rate": 0.00011336757399981408,
"loss": 1.958421516418457,
"memory(GiB)": 105.37,
"step": 1850,
"token_acc": 0.554814506044185,
"train_speed(iter/s)": 0.212073
},
{
"epoch": 0.7145608628659477,
"grad_norm": 1.0286951065063477,
"learning_rate": 0.00011329035393627881,
"loss": 1.9496952056884767,
"memory(GiB)": 105.37,
"step": 1855,
"token_acc": 0.5602315742596303,
"train_speed(iter/s)": 0.212393
},
{
"epoch": 0.7164869029275809,
"grad_norm": 0.8791049718856812,
"learning_rate": 0.0001132129048955774,
"loss": 1.8760465621948241,
"memory(GiB)": 105.37,
"step": 1860,
"token_acc": 0.5608375778155065,
"train_speed(iter/s)": 0.212071
},
{
"epoch": 0.7184129429892142,
"grad_norm": 0.8164251446723938,
"learning_rate": 0.00011313522722687183,
"loss": 1.9845855712890625,
"memory(GiB)": 105.37,
"step": 1865,
"token_acc": 0.5581208053691276,
"train_speed(iter/s)": 0.212399
},
{
"epoch": 0.7203389830508474,
"grad_norm": 19.95476531982422,
"learning_rate": 0.00011305732128035484,
"loss": 1.9429607391357422,
"memory(GiB)": 105.37,
"step": 1870,
"token_acc": 0.5788177339901478,
"train_speed(iter/s)": 0.212724
},
{
"epoch": 0.7222650231124808,
"grad_norm": 1.211210012435913,
"learning_rate": 0.00011297918740724829,
"loss": 1.9235092163085938,
"memory(GiB)": 105.37,
"step": 1875,
"token_acc": 0.5666144200626959,
"train_speed(iter/s)": 0.212378
},
{
"epoch": 0.724191063174114,
"grad_norm": 1.090421438217163,
"learning_rate": 0.00011290082595980162,
"loss": 1.9440628051757813,
"memory(GiB)": 105.37,
"step": 1880,
"token_acc": 0.5681221665473634,
"train_speed(iter/s)": 0.212686
},
{
"epoch": 0.7261171032357473,
"grad_norm": 8.611966133117676,
"learning_rate": 0.00011282223729129019,
"loss": 1.8945022583007813,
"memory(GiB)": 105.37,
"step": 1885,
"token_acc": 0.5661334373780725,
"train_speed(iter/s)": 0.21238
},
{
"epoch": 0.7280431432973806,
"grad_norm": 0.7944480180740356,
"learning_rate": 0.00011274342175601377,
"loss": 1.893497848510742,
"memory(GiB)": 105.37,
"step": 1890,
"token_acc": 0.5713922764227642,
"train_speed(iter/s)": 0.212687
},
{
"epoch": 0.7299691833590138,
"grad_norm": 1.341949462890625,
"learning_rate": 0.00011266437970929494,
"loss": 1.940311813354492,
"memory(GiB)": 105.37,
"step": 1895,
"token_acc": 0.5615449915110357,
"train_speed(iter/s)": 0.212159
},
{
"epoch": 0.7318952234206472,
"grad_norm": 1.541922688484192,
"learning_rate": 0.0001125851115074774,
"loss": 1.9760021209716796,
"memory(GiB)": 105.37,
"step": 1900,
"token_acc": 0.5640750670241287,
"train_speed(iter/s)": 0.212474
},
{
"epoch": 0.7338212634822804,
"grad_norm": 0.9927903413772583,
"learning_rate": 0.00011250561750792444,
"loss": 1.874945831298828,
"memory(GiB)": 105.37,
"step": 1905,
"token_acc": 0.5641406636948985,
"train_speed(iter/s)": 0.212788
},
{
"epoch": 0.7357473035439137,
"grad_norm": 1.0107380151748657,
"learning_rate": 0.00011242589806901734,
"loss": 1.893092155456543,
"memory(GiB)": 105.37,
"step": 1910,
"token_acc": 0.5681997371879106,
"train_speed(iter/s)": 0.212372
},
{
"epoch": 0.737673343605547,
"grad_norm": 0.9208437204360962,
"learning_rate": 0.00011234595355015367,
"loss": 1.9173364639282227,
"memory(GiB)": 105.37,
"step": 1915,
"token_acc": 0.5478199718706048,
"train_speed(iter/s)": 0.21269
},
{
"epoch": 0.7395993836671803,
"grad_norm": 1.238067865371704,
"learning_rate": 0.00011226578431174578,
"loss": 1.9457626342773438,
"memory(GiB)": 105.37,
"step": 1920,
"token_acc": 0.5769338173694498,
"train_speed(iter/s)": 0.212353
},
{
"epoch": 0.7415254237288136,
"grad_norm": 1.0721635818481445,
"learning_rate": 0.00011218539071521905,
"loss": 1.8595882415771485,
"memory(GiB)": 105.37,
"step": 1925,
"token_acc": 0.5843278540869173,
"train_speed(iter/s)": 0.212665
},
{
"epoch": 0.7434514637904468,
"grad_norm": 1.2257107496261597,
"learning_rate": 0.00011210477312301042,
"loss": 1.945622444152832,
"memory(GiB)": 105.37,
"step": 1930,
"token_acc": 0.5687169629985583,
"train_speed(iter/s)": 0.212976
},
{
"epoch": 0.7453775038520801,
"grad_norm": 0.7899504899978638,
"learning_rate": 0.00011202393189856658,
"loss": 1.9221580505371094,
"memory(GiB)": 105.37,
"step": 1935,
"token_acc": 0.5593146822815007,
"train_speed(iter/s)": 0.212436
},
{
"epoch": 0.7473035439137135,
"grad_norm": 1.225388765335083,
"learning_rate": 0.00011194286740634245,
"loss": 1.9105697631835938,
"memory(GiB)": 105.37,
"step": 1940,
"token_acc": 0.5761794276875484,
"train_speed(iter/s)": 0.212746
},
{
"epoch": 0.7492295839753467,
"grad_norm": 0.8033237457275391,
"learning_rate": 0.00011186158001179953,
"loss": 1.8814922332763673,
"memory(GiB)": 105.37,
"step": 1945,
"token_acc": 0.5732989911998283,
"train_speed(iter/s)": 0.212331
},
{
"epoch": 0.75115562403698,
"grad_norm": 0.9364333152770996,
"learning_rate": 0.00011178007008140417,
"loss": 1.9186790466308594,
"memory(GiB)": 105.37,
"step": 1950,
"token_acc": 0.555024962014326,
"train_speed(iter/s)": 0.21264
},
{
"epoch": 0.7530816640986132,
"grad_norm": 1.0878405570983887,
"learning_rate": 0.00011169833798262604,
"loss": 1.9157623291015624,
"memory(GiB)": 105.37,
"step": 1955,
"token_acc": 0.5661790938280414,
"train_speed(iter/s)": 0.212411
},
{
"epoch": 0.7550077041602465,
"grad_norm": 0.8569443225860596,
"learning_rate": 0.00011161638408393635,
"loss": 1.9059930801391602,
"memory(GiB)": 105.37,
"step": 1960,
"token_acc": 0.5630813953488372,
"train_speed(iter/s)": 0.212724
},
{
"epoch": 0.7569337442218799,
"grad_norm": 0.8677403926849365,
"learning_rate": 0.00011153420875480627,
"loss": 1.901895523071289,
"memory(GiB)": 105.37,
"step": 1965,
"token_acc": 0.5575289575289575,
"train_speed(iter/s)": 0.213032
},
{
"epoch": 0.7588597842835131,
"grad_norm": 0.8206605315208435,
"learning_rate": 0.00011145181236570526,
"loss": 1.95764102935791,
"memory(GiB)": 105.37,
"step": 1970,
"token_acc": 0.554931640625,
"train_speed(iter/s)": 0.212685
},
{
"epoch": 0.7607858243451464,
"grad_norm": 2.4774723052978516,
"learning_rate": 0.00011136919528809936,
"loss": 1.9139698028564454,
"memory(GiB)": 105.37,
"step": 1975,
"token_acc": 0.5821572580645161,
"train_speed(iter/s)": 0.212991
},
{
"epoch": 0.7627118644067796,
"grad_norm": 0.8873789310455322,
"learning_rate": 0.0001112863578944495,
"loss": 1.9036279678344727,
"memory(GiB)": 105.37,
"step": 1980,
"token_acc": 0.5855191256830601,
"train_speed(iter/s)": 0.212472
},
{
"epoch": 0.764637904468413,
"grad_norm": 0.8643931150436401,
"learning_rate": 0.00011120330055820992,
"loss": 1.9084108352661133,
"memory(GiB)": 105.37,
"step": 1985,
"token_acc": 0.5609284332688588,
"train_speed(iter/s)": 0.212777
},
{
"epoch": 0.7665639445300462,
"grad_norm": 1.2380619049072266,
"learning_rate": 0.00011112002365382642,
"loss": 1.901507568359375,
"memory(GiB)": 105.37,
"step": 1990,
"token_acc": 0.5783442469597755,
"train_speed(iter/s)": 0.213082
},
{
"epoch": 0.7684899845916795,
"grad_norm": 1.3662925958633423,
"learning_rate": 0.0001110365275567346,
"loss": 1.8699583053588866,
"memory(GiB)": 105.37,
"step": 1995,
"token_acc": 0.5565415244596132,
"train_speed(iter/s)": 0.212768
},
{
"epoch": 0.7704160246533128,
"grad_norm": 1.0294005870819092,
"learning_rate": 0.00011095281264335833,
"loss": 1.9061019897460938,
"memory(GiB)": 105.37,
"step": 2000,
"token_acc": 0.551140544518028,
"train_speed(iter/s)": 0.213069
},
{
"epoch": 0.772342064714946,
"grad_norm": 1.987120270729065,
"learning_rate": 0.00011086887929110791,
"loss": 1.9450611114501952,
"memory(GiB)": 105.37,
"step": 2005,
"token_acc": 0.555,
"train_speed(iter/s)": 0.211114
},
{
"epoch": 0.7742681047765794,
"grad_norm": 1.4287042617797852,
"learning_rate": 0.00011078472787837844,
"loss": 1.9300682067871093,
"memory(GiB)": 105.37,
"step": 2010,
"token_acc": 0.5772629567709577,
"train_speed(iter/s)": 0.211419
},
{
"epoch": 0.7761941448382126,
"grad_norm": 1.0672380924224854,
"learning_rate": 0.00011070035878454811,
"loss": 1.9267253875732422,
"memory(GiB)": 105.37,
"step": 2015,
"token_acc": 0.5817198177676538,
"train_speed(iter/s)": 0.211715
},
{
"epoch": 0.7781201848998459,
"grad_norm": 0.7847228050231934,
"learning_rate": 0.00011061577238997646,
"loss": 1.9650281906127929,
"memory(GiB)": 105.37,
"step": 2020,
"token_acc": 0.5662796323173682,
"train_speed(iter/s)": 0.211848
},
{
"epoch": 0.7800462249614792,
"grad_norm": 1.0664207935333252,
"learning_rate": 0.0001105309690760027,
"loss": 1.9179840087890625,
"memory(GiB)": 105.37,
"step": 2025,
"token_acc": 0.554618213281419,
"train_speed(iter/s)": 0.212148
},
{
"epoch": 0.7819722650231125,
"grad_norm": 0.8073892593383789,
"learning_rate": 0.00011044594922494394,
"loss": 1.9462203979492188,
"memory(GiB)": 105.37,
"step": 2030,
"token_acc": 0.5680738786279683,
"train_speed(iter/s)": 0.211927
},
{
"epoch": 0.7838983050847458,
"grad_norm": 0.8676369190216064,
"learning_rate": 0.00011036071322009356,
"loss": 1.9499420166015624,
"memory(GiB)": 105.37,
"step": 2035,
"token_acc": 0.5589616810877627,
"train_speed(iter/s)": 0.212221
},
{
"epoch": 0.785824345146379,
"grad_norm": 1.7634555101394653,
"learning_rate": 0.00011027526144571935,
"loss": 1.894424057006836,
"memory(GiB)": 105.37,
"step": 2040,
"token_acc": 0.574585635359116,
"train_speed(iter/s)": 0.211689
},
{
"epoch": 0.7877503852080123,
"grad_norm": 1.019718050956726,
"learning_rate": 0.0001101895942870619,
"loss": 1.934789276123047,
"memory(GiB)": 105.37,
"step": 2045,
"token_acc": 0.5721692243882207,
"train_speed(iter/s)": 0.211983
},
{
"epoch": 0.7896764252696457,
"grad_norm": 1.0537678003311157,
"learning_rate": 0.00011010371213033281,
"loss": 1.9338647842407226,
"memory(GiB)": 105.37,
"step": 2050,
"token_acc": 0.5722924683892249,
"train_speed(iter/s)": 0.21228
},
{
"epoch": 0.7916024653312789,
"grad_norm": 0.880235493183136,
"learning_rate": 0.00011001761536271291,
"loss": 1.9429962158203125,
"memory(GiB)": 105.37,
"step": 2055,
"token_acc": 0.5754468209786112,
"train_speed(iter/s)": 0.211759
},
{
"epoch": 0.7935285053929122,
"grad_norm": 1.0405648946762085,
"learning_rate": 0.00010993130437235061,
"loss": 1.8974205017089845,
"memory(GiB)": 105.37,
"step": 2060,
"token_acc": 0.5553140621603999,
"train_speed(iter/s)": 0.212051
},
{
"epoch": 0.7954545454545454,
"grad_norm": 1.0976312160491943,
"learning_rate": 0.00010984477954836005,
"loss": 1.8986242294311524,
"memory(GiB)": 105.37,
"step": 2065,
"token_acc": 0.5683109797681292,
"train_speed(iter/s)": 0.211509
},
{
"epoch": 0.7973805855161787,
"grad_norm": 0.735440194606781,
"learning_rate": 0.00010975804128081944,
"loss": 1.8711969375610351,
"memory(GiB)": 105.37,
"step": 2070,
"token_acc": 0.5567129629629629,
"train_speed(iter/s)": 0.211793
},
{
"epoch": 0.7993066255778121,
"grad_norm": 0.8371529579162598,
"learning_rate": 0.00010967108996076922,
"loss": 1.9112056732177733,
"memory(GiB)": 105.37,
"step": 2075,
"token_acc": 0.5793629185951539,
"train_speed(iter/s)": 0.212083
},
{
"epoch": 0.8012326656394453,
"grad_norm": 1.1095043420791626,
"learning_rate": 0.0001095839259802103,
"loss": 1.9394035339355469,
"memory(GiB)": 105.37,
"step": 2080,
"token_acc": 0.557458426408538,
"train_speed(iter/s)": 0.211717
},
{
"epoch": 0.8031587057010786,
"grad_norm": 1.0045527219772339,
"learning_rate": 0.0001094965497321024,
"loss": 1.9097469329833985,
"memory(GiB)": 105.37,
"step": 2085,
"token_acc": 0.6036697247706422,
"train_speed(iter/s)": 0.212009
},
{
"epoch": 0.8050847457627118,
"grad_norm": 1.7117685079574585,
"learning_rate": 0.00010940896161036217,
"loss": 1.9298751831054688,
"memory(GiB)": 105.37,
"step": 2090,
"token_acc": 0.5724203218680972,
"train_speed(iter/s)": 0.211707
},
{
"epoch": 0.8070107858243452,
"grad_norm": 1.063154697418213,
"learning_rate": 0.00010932116200986142,
"loss": 1.9341747283935546,
"memory(GiB)": 105.37,
"step": 2095,
"token_acc": 0.5577822311289246,
"train_speed(iter/s)": 0.211991
},
{
"epoch": 0.8089368258859785,
"grad_norm": 0.9046605229377747,
"learning_rate": 0.00010923315132642537,
"loss": 1.943634033203125,
"memory(GiB)": 105.37,
"step": 2100,
"token_acc": 0.5559433779329067,
"train_speed(iter/s)": 0.211745
},
{
"epoch": 0.8108628659476117,
"grad_norm": 0.9120232462882996,
"learning_rate": 0.0001091449299568309,
"loss": 1.8745365142822266,
"memory(GiB)": 105.37,
"step": 2105,
"token_acc": 0.5791666666666667,
"train_speed(iter/s)": 0.212024
},
{
"epoch": 0.812788906009245,
"grad_norm": 0.8366382718086243,
"learning_rate": 0.00010905649829880466,
"loss": 1.909491729736328,
"memory(GiB)": 105.37,
"step": 2110,
"token_acc": 0.5692370627940274,
"train_speed(iter/s)": 0.212307
},
{
"epoch": 0.8147149460708782,
"grad_norm": 2.30214262008667,
"learning_rate": 0.00010896785675102143,
"loss": 1.932793426513672,
"memory(GiB)": 105.37,
"step": 2115,
"token_acc": 0.5724747474747475,
"train_speed(iter/s)": 0.211878
},
{
"epoch": 0.8166409861325116,
"grad_norm": 1.1005938053131104,
"learning_rate": 0.00010887900571310214,
"loss": 1.9067310333251952,
"memory(GiB)": 105.37,
"step": 2120,
"token_acc": 0.5668124392614189,
"train_speed(iter/s)": 0.212158
},
{
"epoch": 0.8185670261941448,
"grad_norm": 1.9612469673156738,
"learning_rate": 0.00010878994558561222,
"loss": 1.911146354675293,
"memory(GiB)": 105.37,
"step": 2125,
"token_acc": 0.5768487191880135,
"train_speed(iter/s)": 0.211852
},
{
"epoch": 0.8204930662557781,
"grad_norm": 0.9877184629440308,
"learning_rate": 0.00010870067677005968,
"loss": 1.922208023071289,
"memory(GiB)": 105.37,
"step": 2130,
"token_acc": 0.554626334519573,
"train_speed(iter/s)": 0.212133
},
{
"epoch": 0.8224191063174114,
"grad_norm": 0.9043750762939453,
"learning_rate": 0.00010861119966889343,
"loss": 1.8661931991577148,
"memory(GiB)": 105.37,
"step": 2135,
"token_acc": 0.5730914997292907,
"train_speed(iter/s)": 0.212403
},
{
"epoch": 0.8243451463790447,
"grad_norm": 1.2544159889221191,
"learning_rate": 0.0001085215146855013,
"loss": 1.9020450592041016,
"memory(GiB)": 105.37,
"step": 2140,
"token_acc": 0.5564387917329093,
"train_speed(iter/s)": 0.211996
},
{
"epoch": 0.826271186440678,
"grad_norm": 0.7074183225631714,
"learning_rate": 0.00010843162222420842,
"loss": 1.88577880859375,
"memory(GiB)": 105.37,
"step": 2145,
"token_acc": 0.5868421052631579,
"train_speed(iter/s)": 0.212275
},
{
"epoch": 0.8281972265023112,
"grad_norm": 1.2796639204025269,
"learning_rate": 0.00010834152269027517,
"loss": 1.9357921600341796,
"memory(GiB)": 105.37,
"step": 2150,
"token_acc": 0.5649913344887348,
"train_speed(iter/s)": 0.211886
},
{
"epoch": 0.8301232665639445,
"grad_norm": 0.906509280204773,
"learning_rate": 0.00010825121648989555,
"loss": 1.9292556762695312,
"memory(GiB)": 105.37,
"step": 2155,
"token_acc": 0.56531152273274,
"train_speed(iter/s)": 0.212161
},
{
"epoch": 0.8320493066255779,
"grad_norm": 1.2688450813293457,
"learning_rate": 0.00010816070403019526,
"loss": 1.9338062286376954,
"memory(GiB)": 105.37,
"step": 2160,
"token_acc": 0.5687215765538151,
"train_speed(iter/s)": 0.211663
},
{
"epoch": 0.8339753466872111,
"grad_norm": 0.7723739147186279,
"learning_rate": 0.00010806998571922986,
"loss": 1.9361949920654298,
"memory(GiB)": 105.37,
"step": 2165,
"token_acc": 0.5645988805970149,
"train_speed(iter/s)": 0.211939
},
{
"epoch": 0.8359013867488444,
"grad_norm": 0.8162662386894226,
"learning_rate": 0.00010797906196598293,
"loss": 1.8936233520507812,
"memory(GiB)": 105.37,
"step": 2170,
"token_acc": 0.552744630071599,
"train_speed(iter/s)": 0.212212
},
{
"epoch": 0.8378274268104776,
"grad_norm": 0.9353050589561462,
"learning_rate": 0.00010788793318036427,
"loss": 1.9554435729980468,
"memory(GiB)": 105.37,
"step": 2175,
"token_acc": 0.5675565518646831,
"train_speed(iter/s)": 0.211931
},
{
"epoch": 0.8397534668721109,
"grad_norm": 1.354371428489685,
"learning_rate": 0.00010779659977320805,
"loss": 1.9177799224853516,
"memory(GiB)": 105.37,
"step": 2180,
"token_acc": 0.5776081424936387,
"train_speed(iter/s)": 0.212212
},
{
"epoch": 0.8416795069337443,
"grad_norm": 0.8782749772071838,
"learning_rate": 0.00010770506215627084,
"loss": 1.892471694946289,
"memory(GiB)": 105.37,
"step": 2185,
"token_acc": 0.5651615664455382,
"train_speed(iter/s)": 0.211914
},
{
"epoch": 0.8436055469953775,
"grad_norm": 0.9687239527702332,
"learning_rate": 0.00010761332074222994,
"loss": 1.8565200805664062,
"memory(GiB)": 105.37,
"step": 2190,
"token_acc": 0.5587207739854878,
"train_speed(iter/s)": 0.212191
},
{
"epoch": 0.8455315870570108,
"grad_norm": 1.4167234897613525,
"learning_rate": 0.00010752137594468134,
"loss": 1.9247961044311523,
"memory(GiB)": 105.37,
"step": 2195,
"token_acc": 0.5732398165632587,
"train_speed(iter/s)": 0.21246
},
{
"epoch": 0.847457627118644,
"grad_norm": 0.8777409791946411,
"learning_rate": 0.00010742922817813804,
"loss": 1.8779016494750977,
"memory(GiB)": 105.37,
"step": 2200,
"token_acc": 0.5757649344341913,
"train_speed(iter/s)": 0.211995
},
{
"epoch": 0.8493836671802774,
"grad_norm": 0.9414359927177429,
"learning_rate": 0.00010733687785802799,
"loss": 1.8769182205200194,
"memory(GiB)": 105.37,
"step": 2205,
"token_acc": 0.5672020287404903,
"train_speed(iter/s)": 0.212269
},
{
"epoch": 0.8513097072419107,
"grad_norm": 1.0411300659179688,
"learning_rate": 0.00010724432540069236,
"loss": 1.9507434844970704,
"memory(GiB)": 105.37,
"step": 2210,
"token_acc": 0.5724517906336088,
"train_speed(iter/s)": 0.211956
},
{
"epoch": 0.8532357473035439,
"grad_norm": 0.8873267769813538,
"learning_rate": 0.0001071515712233836,
"loss": 1.9126800537109374,
"memory(GiB)": 105.37,
"step": 2215,
"token_acc": 0.5796640944167045,
"train_speed(iter/s)": 0.212227
},
{
"epoch": 0.8551617873651772,
"grad_norm": 0.7825678586959839,
"learning_rate": 0.00010705861574426354,
"loss": 1.9101314544677734,
"memory(GiB)": 105.37,
"step": 2220,
"token_acc": 0.5633668101386896,
"train_speed(iter/s)": 0.211816
},
{
"epoch": 0.8570878274268104,
"grad_norm": 0.8035494685173035,
"learning_rate": 0.00010696545938240157,
"loss": 1.8716983795166016,
"memory(GiB)": 105.37,
"step": 2225,
"token_acc": 0.5648591174906964,
"train_speed(iter/s)": 0.212082
},
{
"epoch": 0.8590138674884438,
"grad_norm": 1.0586990118026733,
"learning_rate": 0.00010687210255777274,
"loss": 1.9421785354614258,
"memory(GiB)": 105.37,
"step": 2230,
"token_acc": 0.5647331786542923,
"train_speed(iter/s)": 0.21235
},
{
"epoch": 0.860939907550077,
"grad_norm": 0.9601324200630188,
"learning_rate": 0.00010677854569125579,
"loss": 1.8767234802246093,
"memory(GiB)": 105.37,
"step": 2235,
"token_acc": 0.5677059097254537,
"train_speed(iter/s)": 0.212425
},
{
"epoch": 0.8628659476117103,
"grad_norm": 1.0070292949676514,
"learning_rate": 0.00010668478920463129,
"loss": 1.9305574417114257,
"memory(GiB)": 105.37,
"step": 2240,
"token_acc": 0.5749811605124341,
"train_speed(iter/s)": 0.212695
},
{
"epoch": 0.8647919876733436,
"grad_norm": 0.7341820597648621,
"learning_rate": 0.00010659083352057982,
"loss": 1.9255226135253907,
"memory(GiB)": 105.37,
"step": 2245,
"token_acc": 0.5655053974484789,
"train_speed(iter/s)": 0.212465
},
{
"epoch": 0.8667180277349769,
"grad_norm": 1.2573742866516113,
"learning_rate": 0.00010649667906267998,
"loss": 1.9455821990966797,
"memory(GiB)": 105.37,
"step": 2250,
"token_acc": 0.558271056352252,
"train_speed(iter/s)": 0.212725
},
{
"epoch": 0.8686440677966102,
"grad_norm": 1.0887494087219238,
"learning_rate": 0.00010640232625540645,
"loss": 1.894921875,
"memory(GiB)": 105.37,
"step": 2255,
"token_acc": 0.5671087533156499,
"train_speed(iter/s)": 0.212992
},
{
"epoch": 0.8705701078582434,
"grad_norm": 1.0962910652160645,
"learning_rate": 0.00010630777552412818,
"loss": 1.8874996185302735,
"memory(GiB)": 105.37,
"step": 2260,
"token_acc": 0.5562913907284768,
"train_speed(iter/s)": 0.212697
},
{
"epoch": 0.8724961479198767,
"grad_norm": 1.082460880279541,
"learning_rate": 0.0001062130272951064,
"loss": 1.8676143646240235,
"memory(GiB)": 105.37,
"step": 2265,
"token_acc": 0.5758513931888545,
"train_speed(iter/s)": 0.212961
},
{
"epoch": 0.8744221879815101,
"grad_norm": 1.1624494791030884,
"learning_rate": 0.00010611808199549267,
"loss": 1.8812053680419922,
"memory(GiB)": 105.37,
"step": 2270,
"token_acc": 0.5735229759299781,
"train_speed(iter/s)": 0.212641
},
{
"epoch": 0.8763482280431433,
"grad_norm": 0.8129061460494995,
"learning_rate": 0.0001060229400533271,
"loss": 1.9643457412719727,
"memory(GiB)": 105.37,
"step": 2275,
"token_acc": 0.5657862854373638,
"train_speed(iter/s)": 0.212903
},
{
"epoch": 0.8782742681047766,
"grad_norm": 1.6256614923477173,
"learning_rate": 0.00010592760189753621,
"loss": 1.918039894104004,
"memory(GiB)": 105.37,
"step": 2280,
"token_acc": 0.5554035567715458,
"train_speed(iter/s)": 0.212707
},
{
"epoch": 0.8802003081664098,
"grad_norm": 0.9473841786384583,
"learning_rate": 0.00010583206795793119,
"loss": 1.8533285140991211,
"memory(GiB)": 105.37,
"step": 2285,
"token_acc": 0.5733795794493822,
"train_speed(iter/s)": 0.212956
},
{
"epoch": 0.8821263482280431,
"grad_norm": 1.5509757995605469,
"learning_rate": 0.00010573633866520582,
"loss": 1.8473834991455078,
"memory(GiB)": 105.37,
"step": 2290,
"token_acc": 0.5614803993182371,
"train_speed(iter/s)": 0.213213
},
{
"epoch": 0.8840523882896765,
"grad_norm": 1.2025234699249268,
"learning_rate": 0.00010564041445093464,
"loss": 1.9006170272827148,
"memory(GiB)": 105.37,
"step": 2295,
"token_acc": 0.5547520661157025,
"train_speed(iter/s)": 0.212826
},
{
"epoch": 0.8859784283513097,
"grad_norm": 0.8838430047035217,
"learning_rate": 0.00010554429574757087,
"loss": 1.9109169006347657,
"memory(GiB)": 105.37,
"step": 2300,
"token_acc": 0.5698838606327593,
"train_speed(iter/s)": 0.213085
},
{
"epoch": 0.887904468412943,
"grad_norm": 1.3309389352798462,
"learning_rate": 0.00010544798298844465,
"loss": 1.9207313537597657,
"memory(GiB)": 105.37,
"step": 2305,
"token_acc": 0.5609756097560976,
"train_speed(iter/s)": 0.212598
},
{
"epoch": 0.8898305084745762,
"grad_norm": 0.9611072540283203,
"learning_rate": 0.0001053514766077609,
"loss": 1.8312957763671875,
"memory(GiB)": 105.37,
"step": 2310,
"token_acc": 0.5659125188536953,
"train_speed(iter/s)": 0.212855
},
{
"epoch": 0.8917565485362096,
"grad_norm": 0.8508879542350769,
"learning_rate": 0.00010525477704059745,
"loss": 1.86734619140625,
"memory(GiB)": 105.37,
"step": 2315,
"token_acc": 0.5711055844449469,
"train_speed(iter/s)": 0.212505
},
{
"epoch": 0.8936825885978429,
"grad_norm": 0.6272566318511963,
"learning_rate": 0.00010515788472290309,
"loss": 1.8701967239379882,
"memory(GiB)": 105.37,
"step": 2320,
"token_acc": 0.5673699603091706,
"train_speed(iter/s)": 0.212656
},
{
"epoch": 0.8956086286594761,
"grad_norm": 1.245864987373352,
"learning_rate": 0.00010506080009149558,
"loss": 1.8950122833251952,
"memory(GiB)": 105.37,
"step": 2325,
"token_acc": 0.5716608594657375,
"train_speed(iter/s)": 0.21277
},
{
"epoch": 0.8975346687211094,
"grad_norm": 0.8120641112327576,
"learning_rate": 0.00010496352358405967,
"loss": 1.8934310913085937,
"memory(GiB)": 105.37,
"step": 2330,
"token_acc": 0.5543902439024391,
"train_speed(iter/s)": 0.2125
},
{
"epoch": 0.8994607087827426,
"grad_norm": 1.410618782043457,
"learning_rate": 0.00010486605563914516,
"loss": 1.9373258590698241,
"memory(GiB)": 105.37,
"step": 2335,
"token_acc": 0.5496739547372459,
"train_speed(iter/s)": 0.212755
},
{
"epoch": 0.901386748844376,
"grad_norm": 1.2583314180374146,
"learning_rate": 0.00010476839669616486,
"loss": 1.8911588668823243,
"memory(GiB)": 105.37,
"step": 2340,
"token_acc": 0.5606508875739645,
"train_speed(iter/s)": 0.212218
},
{
"epoch": 0.9033127889060092,
"grad_norm": 0.8492756485939026,
"learning_rate": 0.00010467054719539273,
"loss": 1.8848827362060547,
"memory(GiB)": 105.37,
"step": 2345,
"token_acc": 0.5775429326287979,
"train_speed(iter/s)": 0.212472
},
{
"epoch": 0.9052388289676425,
"grad_norm": 1.1416641473770142,
"learning_rate": 0.00010457250757796175,
"loss": 1.8898639678955078,
"memory(GiB)": 105.37,
"step": 2350,
"token_acc": 0.5818945403639757,
"train_speed(iter/s)": 0.21273
},
{
"epoch": 0.9071648690292758,
"grad_norm": 1.9363975524902344,
"learning_rate": 0.00010447427828586202,
"loss": 1.8919353485107422,
"memory(GiB)": 105.37,
"step": 2355,
"token_acc": 0.571497005988024,
"train_speed(iter/s)": 0.212447
},
{
"epoch": 0.9090909090909091,
"grad_norm": 0.7731749415397644,
"learning_rate": 0.00010437585976193878,
"loss": 1.883367919921875,
"memory(GiB)": 105.37,
"step": 2360,
"token_acc": 0.5764480408858603,
"train_speed(iter/s)": 0.212691
},
{
"epoch": 0.9110169491525424,
"grad_norm": 0.9075607657432556,
"learning_rate": 0.00010427725244989029,
"loss": 1.8688194274902343,
"memory(GiB)": 105.37,
"step": 2365,
"token_acc": 0.5617529880478087,
"train_speed(iter/s)": 0.212255
},
{
"epoch": 0.9129429892141756,
"grad_norm": 1.7208845615386963,
"learning_rate": 0.00010417845679426605,
"loss": 1.8929000854492188,
"memory(GiB)": 105.37,
"step": 2370,
"token_acc": 0.5695077484047402,
"train_speed(iter/s)": 0.212508
},
{
"epoch": 0.9148690292758089,
"grad_norm": 1.597895860671997,
"learning_rate": 0.00010407947324046453,
"loss": 1.846609115600586,
"memory(GiB)": 105.37,
"step": 2375,
"token_acc": 0.5782608695652174,
"train_speed(iter/s)": 0.212275
},
{
"epoch": 0.9167950693374423,
"grad_norm": 1.5805600881576538,
"learning_rate": 0.00010398030223473143,
"loss": 1.8697330474853515,
"memory(GiB)": 105.37,
"step": 2380,
"token_acc": 0.5650087260034904,
"train_speed(iter/s)": 0.21237
},
{
"epoch": 0.9187211093990755,
"grad_norm": 0.9898545145988464,
"learning_rate": 0.0001038809442241574,
"loss": 1.9131847381591798,
"memory(GiB)": 105.37,
"step": 2385,
"token_acc": 0.5714651639344263,
"train_speed(iter/s)": 0.212544
},
{
"epoch": 0.9206471494607088,
"grad_norm": 0.8661528825759888,
"learning_rate": 0.00010378139965667628,
"loss": 1.8387161254882813,
"memory(GiB)": 105.37,
"step": 2390,
"token_acc": 0.5752688172043011,
"train_speed(iter/s)": 0.21226
},
{
"epoch": 0.922573189522342,
"grad_norm": 0.797809898853302,
"learning_rate": 0.00010368166898106287,
"loss": 1.9009563446044921,
"memory(GiB)": 105.37,
"step": 2395,
"token_acc": 0.5559462254395037,
"train_speed(iter/s)": 0.212486
},
{
"epoch": 0.9244992295839753,
"grad_norm": 0.9048339128494263,
"learning_rate": 0.00010358175264693109,
"loss": 1.8808311462402343,
"memory(GiB)": 105.37,
"step": 2400,
"token_acc": 0.548618219037871,
"train_speed(iter/s)": 0.21212
},
{
"epoch": 0.9264252696456087,
"grad_norm": 0.7007138729095459,
"learning_rate": 0.00010348165110473178,
"loss": 1.8868871688842774,
"memory(GiB)": 105.37,
"step": 2405,
"token_acc": 0.5656154628687691,
"train_speed(iter/s)": 0.2122
},
{
"epoch": 0.9283513097072419,
"grad_norm": 0.8757054209709167,
"learning_rate": 0.00010338136480575076,
"loss": 1.9127147674560547,
"memory(GiB)": 105.37,
"step": 2410,
"token_acc": 0.583402489626556,
"train_speed(iter/s)": 0.212415
},
{
"epoch": 0.9302773497688752,
"grad_norm": 1.1285896301269531,
"learning_rate": 0.00010328089420210684,
"loss": 1.8715789794921875,
"memory(GiB)": 105.37,
"step": 2415,
"token_acc": 0.5731398295323659,
"train_speed(iter/s)": 0.212224
},
{
"epoch": 0.9322033898305084,
"grad_norm": 0.9764662981033325,
"learning_rate": 0.00010318023974674965,
"loss": 1.8707473754882813,
"memory(GiB)": 105.37,
"step": 2420,
"token_acc": 0.5676027041081644,
"train_speed(iter/s)": 0.212157
},
{
"epoch": 0.9341294298921418,
"grad_norm": 2.468919038772583,
"learning_rate": 0.00010307940189345774,
"loss": 1.9460697174072266,
"memory(GiB)": 105.37,
"step": 2425,
"token_acc": 0.5766272189349112,
"train_speed(iter/s)": 0.211966
},
{
"epoch": 0.9360554699537751,
"grad_norm": 0.828601598739624,
"learning_rate": 0.00010297838109683646,
"loss": 1.8588157653808595,
"memory(GiB)": 105.37,
"step": 2430,
"token_acc": 0.5899778516057586,
"train_speed(iter/s)": 0.211938
},
{
"epoch": 0.9379815100154083,
"grad_norm": 0.7998688220977783,
"learning_rate": 0.0001028771778123159,
"loss": 1.8905961990356446,
"memory(GiB)": 105.37,
"step": 2435,
"token_acc": 0.566873339238264,
"train_speed(iter/s)": 0.211865
},
{
"epoch": 0.9399075500770416,
"grad_norm": 1.2160381078720093,
"learning_rate": 0.00010277579249614883,
"loss": 1.9105518341064454,
"memory(GiB)": 105.37,
"step": 2440,
"token_acc": 0.5792669702884407,
"train_speed(iter/s)": 0.212108
},
{
"epoch": 0.9418335901386748,
"grad_norm": 1.2896326780319214,
"learning_rate": 0.0001026742256054087,
"loss": 1.9445823669433593,
"memory(GiB)": 105.37,
"step": 2445,
"token_acc": 0.5425305688463583,
"train_speed(iter/s)": 0.212147
},
{
"epoch": 0.9437596302003082,
"grad_norm": 1.93269944190979,
"learning_rate": 0.0001025724775979876,
"loss": 1.898458480834961,
"memory(GiB)": 105.37,
"step": 2450,
"token_acc": 0.5846387064173825,
"train_speed(iter/s)": 0.211977
},
{
"epoch": 0.9456856702619415,
"grad_norm": 0.7103263735771179,
"learning_rate": 0.00010247054893259408,
"loss": 1.9032676696777344,
"memory(GiB)": 105.37,
"step": 2455,
"token_acc": 0.5615275813295615,
"train_speed(iter/s)": 0.212075
},
{
"epoch": 0.9476117103235747,
"grad_norm": 1.6064002513885498,
"learning_rate": 0.00010236844006875114,
"loss": 1.8416248321533204,
"memory(GiB)": 105.37,
"step": 2460,
"token_acc": 0.5761274306992139,
"train_speed(iter/s)": 0.211906
},
{
"epoch": 0.949537750385208,
"grad_norm": 1.1327142715454102,
"learning_rate": 0.00010226615146679418,
"loss": 1.884109115600586,
"memory(GiB)": 105.37,
"step": 2465,
"token_acc": 0.565477462080752,
"train_speed(iter/s)": 0.212087
},
{
"epoch": 0.9514637904468413,
"grad_norm": 0.8920122981071472,
"learning_rate": 0.00010216368358786897,
"loss": 1.957171630859375,
"memory(GiB)": 105.37,
"step": 2470,
"token_acc": 0.5472296802538443,
"train_speed(iter/s)": 0.212327
},
{
"epoch": 0.9533898305084746,
"grad_norm": 1.9198769330978394,
"learning_rate": 0.00010206103689392941,
"loss": 1.8792835235595704,
"memory(GiB)": 105.37,
"step": 2475,
"token_acc": 0.5587679005674142,
"train_speed(iter/s)": 0.212011
},
{
"epoch": 0.9553158705701078,
"grad_norm": 1.4284560680389404,
"learning_rate": 0.00010195821184773563,
"loss": 1.8531095504760742,
"memory(GiB)": 105.37,
"step": 2480,
"token_acc": 0.5927850810149802,
"train_speed(iter/s)": 0.212255
},
{
"epoch": 0.9572419106317411,
"grad_norm": 0.8060047030448914,
"learning_rate": 0.00010185520891285175,
"loss": 1.9149555206298827,
"memory(GiB)": 105.37,
"step": 2485,
"token_acc": 0.5785272914521112,
"train_speed(iter/s)": 0.211859
},
{
"epoch": 0.9591679506933745,
"grad_norm": 2.11312198638916,
"learning_rate": 0.0001017520285536439,
"loss": 1.8686796188354493,
"memory(GiB)": 105.37,
"step": 2490,
"token_acc": 0.575089556351612,
"train_speed(iter/s)": 0.212098
},
{
"epoch": 0.9610939907550077,
"grad_norm": 0.931461751461029,
"learning_rate": 0.00010164867123527815,
"loss": 1.8880146026611329,
"memory(GiB)": 105.37,
"step": 2495,
"token_acc": 0.5730290456431535,
"train_speed(iter/s)": 0.211984
},
{
"epoch": 0.963020030816641,
"grad_norm": 0.7579106688499451,
"learning_rate": 0.00010154513742371824,
"loss": 1.878654670715332,
"memory(GiB)": 105.37,
"step": 2500,
"token_acc": 0.5715559518502006,
"train_speed(iter/s)": 0.212222
},
{
"epoch": 0.9649460708782742,
"grad_norm": 0.9832830429077148,
"learning_rate": 0.00010144142758572364,
"loss": 1.8780696868896485,
"memory(GiB)": 105.37,
"step": 2505,
"token_acc": 0.5861377312235346,
"train_speed(iter/s)": 0.212441
},
{
"epoch": 0.9668721109399075,
"grad_norm": 2.291651964187622,
"learning_rate": 0.00010133754218884742,
"loss": 1.8989700317382812,
"memory(GiB)": 105.37,
"step": 2510,
"token_acc": 0.5676322719655255,
"train_speed(iter/s)": 0.212319
},
{
"epoch": 0.9687981510015409,
"grad_norm": 0.7597490549087524,
"learning_rate": 0.00010123348170143408,
"loss": 1.8973007202148438,
"memory(GiB)": 105.37,
"step": 2515,
"token_acc": 0.5610299579103738,
"train_speed(iter/s)": 0.212287
},
{
"epoch": 0.9707241910631741,
"grad_norm": 1.1047621965408325,
"learning_rate": 0.00010112924659261751,
"loss": 1.8917285919189453,
"memory(GiB)": 105.37,
"step": 2520,
"token_acc": 0.5817012569424145,
"train_speed(iter/s)": 0.212107
},
{
"epoch": 0.9726502311248074,
"grad_norm": 0.755590558052063,
"learning_rate": 0.00010102483733231882,
"loss": 1.9304916381835937,
"memory(GiB)": 105.37,
"step": 2525,
"token_acc": 0.5767375886524823,
"train_speed(iter/s)": 0.21201
},
{
"epoch": 0.9745762711864406,
"grad_norm": 0.978504478931427,
"learning_rate": 0.00010092025439124425,
"loss": 1.8841156005859374,
"memory(GiB)": 105.37,
"step": 2530,
"token_acc": 0.5961474593158419,
"train_speed(iter/s)": 0.212219
},
{
"epoch": 0.976502311248074,
"grad_norm": 0.6544843316078186,
"learning_rate": 0.00010081549824088304,
"loss": 1.9175731658935546,
"memory(GiB)": 105.37,
"step": 2535,
"token_acc": 0.5591259640102828,
"train_speed(iter/s)": 0.212346
},
{
"epoch": 0.9784283513097073,
"grad_norm": 1.4386008977890015,
"learning_rate": 0.0001007105693535053,
"loss": 1.8448196411132813,
"memory(GiB)": 118.24,
"step": 2540,
"token_acc": 0.5567567567567567,
"train_speed(iter/s)": 0.212174
},
{
"epoch": 0.9803543913713405,
"grad_norm": 1.1577261686325073,
"learning_rate": 0.00010060546820215991,
"loss": 1.912937545776367,
"memory(GiB)": 118.24,
"step": 2545,
"token_acc": 0.5594997241125621,
"train_speed(iter/s)": 0.212406
},
{
"epoch": 0.9822804314329738,
"grad_norm": 1.6608984470367432,
"learning_rate": 0.00010050019526067237,
"loss": 1.8221038818359374,
"memory(GiB)": 118.24,
"step": 2550,
"token_acc": 0.6011602610587382,
"train_speed(iter/s)": 0.212397
},
{
"epoch": 0.984206471494607,
"grad_norm": 1.2616746425628662,
"learning_rate": 0.00010039475100364256,
"loss": 1.8744300842285155,
"memory(GiB)": 118.24,
"step": 2555,
"token_acc": 0.5777464126087979,
"train_speed(iter/s)": 0.212629
},
{
"epoch": 0.9861325115562404,
"grad_norm": 0.8126121759414673,
"learning_rate": 0.00010028913590644287,
"loss": 1.8420495986938477,
"memory(GiB)": 118.24,
"step": 2560,
"token_acc": 0.5801255801255801,
"train_speed(iter/s)": 0.212868
},
{
"epoch": 0.9880585516178737,
"grad_norm": 0.7576323747634888,
"learning_rate": 0.00010018335044521572,
"loss": 1.8606962203979491,
"memory(GiB)": 118.24,
"step": 2565,
"token_acc": 0.5748314606741574,
"train_speed(iter/s)": 0.212931
},
{
"epoch": 0.9899845916795069,
"grad_norm": 3.2989680767059326,
"learning_rate": 0.0001000773950968717,
"loss": 1.8900465011596679,
"memory(GiB)": 118.24,
"step": 2570,
"token_acc": 0.5676959619952494,
"train_speed(iter/s)": 0.213164
},
{
"epoch": 0.9919106317411402,
"grad_norm": 0.7823702096939087,
"learning_rate": 9.997127033908721e-05,
"loss": 1.8199888229370118,
"memory(GiB)": 118.24,
"step": 2575,
"token_acc": 0.5861524582769508,
"train_speed(iter/s)": 0.213399
},
{
"epoch": 0.9938366718027735,
"grad_norm": 6.944242477416992,
"learning_rate": 9.986497665030247e-05,
"loss": 1.900966262817383,
"memory(GiB)": 118.24,
"step": 2580,
"token_acc": 0.5799475753604194,
"train_speed(iter/s)": 0.213636
},
{
"epoch": 0.9957627118644068,
"grad_norm": 1.096247911453247,
"learning_rate": 9.97585145097192e-05,
"loss": 1.92723388671875,
"memory(GiB)": 118.24,
"step": 2585,
"token_acc": 0.5740554156171285,
"train_speed(iter/s)": 0.213873
},
{
"epoch": 0.99768875192604,
"grad_norm": 0.8583908081054688,
"learning_rate": 9.965188439729867e-05,
"loss": 1.852244758605957,
"memory(GiB)": 118.24,
"step": 2590,
"token_acc": 0.5778296878318114,
"train_speed(iter/s)": 0.214109
},
{
"epoch": 0.9996147919876733,
"grad_norm": 0.879838764667511,
"learning_rate": 9.954508679375928e-05,
"loss": 1.8662124633789063,
"memory(GiB)": 118.24,
"step": 2595,
"token_acc": 0.5844184506731406,
"train_speed(iter/s)": 0.214345
},
{
"epoch": 1.0015408320493067,
"grad_norm": 0.6492385268211365,
"learning_rate": 9.943812218057466e-05,
"loss": 1.8803394317626954,
"memory(GiB)": 118.24,
"step": 2600,
"token_acc": 0.5794724007980492,
"train_speed(iter/s)": 0.213595
},
{
"epoch": 1.0034668721109399,
"grad_norm": 0.6972906589508057,
"learning_rate": 9.933099103997122e-05,
"loss": 1.880356216430664,
"memory(GiB)": 118.24,
"step": 2605,
"token_acc": 0.5773381294964028,
"train_speed(iter/s)": 0.213827
},
{
"epoch": 1.005392912172573,
"grad_norm": 1.115248441696167,
"learning_rate": 9.922369385492626e-05,
"loss": 1.923149871826172,
"memory(GiB)": 118.24,
"step": 2610,
"token_acc": 0.5678496868475992,
"train_speed(iter/s)": 0.213621
},
{
"epoch": 1.0073189522342065,
"grad_norm": 1.3598155975341797,
"learning_rate": 9.911623110916557e-05,
"loss": 1.863555908203125,
"memory(GiB)": 118.24,
"step": 2615,
"token_acc": 0.5800900185332274,
"train_speed(iter/s)": 0.213852
},
{
"epoch": 1.0092449922958397,
"grad_norm": 0.837518036365509,
"learning_rate": 9.900860328716135e-05,
"loss": 1.8928642272949219,
"memory(GiB)": 118.24,
"step": 2620,
"token_acc": 0.561210719105456,
"train_speed(iter/s)": 0.214082
},
{
"epoch": 1.011171032357473,
"grad_norm": 0.7452426552772522,
"learning_rate": 9.890081087413008e-05,
"loss": 1.839437484741211,
"memory(GiB)": 118.24,
"step": 2625,
"token_acc": 0.5713938805245264,
"train_speed(iter/s)": 0.214139
},
{
"epoch": 1.0130970724191064,
"grad_norm": 0.8589769005775452,
"learning_rate": 9.879285435603011e-05,
"loss": 1.8793828964233399,
"memory(GiB)": 118.24,
"step": 2630,
"token_acc": 0.6016576016576016,
"train_speed(iter/s)": 0.214366
},
{
"epoch": 1.0150231124807396,
"grad_norm": 3.8594565391540527,
"learning_rate": 9.868473421955979e-05,
"loss": 1.8930324554443358,
"memory(GiB)": 118.24,
"step": 2635,
"token_acc": 0.5802946148273364,
"train_speed(iter/s)": 0.214391
},
{
"epoch": 1.0169491525423728,
"grad_norm": 6.350452899932861,
"learning_rate": 9.857645095215496e-05,
"loss": 1.8867511749267578,
"memory(GiB)": 118.24,
"step": 2640,
"token_acc": 0.5820727026416799,
"train_speed(iter/s)": 0.21462
},
{
"epoch": 1.018875192604006,
"grad_norm": 1.067470908164978,
"learning_rate": 9.846800504198706e-05,
"loss": 1.8895866394042968,
"memory(GiB)": 118.24,
"step": 2645,
"token_acc": 0.5662457406293846,
"train_speed(iter/s)": 0.214667
},
{
"epoch": 1.0208012326656395,
"grad_norm": 1.4716510772705078,
"learning_rate": 9.835939697796059e-05,
"loss": 1.8874019622802733,
"memory(GiB)": 118.24,
"step": 2650,
"token_acc": 0.5717100941537114,
"train_speed(iter/s)": 0.214657
},
{
"epoch": 1.0227272727272727,
"grad_norm": 2.5537991523742676,
"learning_rate": 9.825062724971125e-05,
"loss": 1.8482269287109374,
"memory(GiB)": 118.24,
"step": 2655,
"token_acc": 0.5548946716232962,
"train_speed(iter/s)": 0.214886
},
{
"epoch": 1.024653312788906,
"grad_norm": 1.1057168245315552,
"learning_rate": 9.814169634760345e-05,
"loss": 1.9174837112426757,
"memory(GiB)": 118.24,
"step": 2660,
"token_acc": 0.5558971492453885,
"train_speed(iter/s)": 0.214778
},
{
"epoch": 1.0265793528505394,
"grad_norm": 1.579986810684204,
"learning_rate": 9.803260476272827e-05,
"loss": 1.8766490936279296,
"memory(GiB)": 118.24,
"step": 2665,
"token_acc": 0.5723290261582099,
"train_speed(iter/s)": 0.214812
},
{
"epoch": 1.0285053929121726,
"grad_norm": 0.7831318378448486,
"learning_rate": 9.792335298690119e-05,
"loss": 1.8679998397827149,
"memory(GiB)": 118.24,
"step": 2670,
"token_acc": 0.5653755617376418,
"train_speed(iter/s)": 0.215039
},
{
"epoch": 1.0304314329738058,
"grad_norm": 0.7311432361602783,
"learning_rate": 9.781394151265985e-05,
"loss": 1.8989303588867188,
"memory(GiB)": 118.24,
"step": 2675,
"token_acc": 0.5833557046979866,
"train_speed(iter/s)": 0.215266
},
{
"epoch": 1.0323574730354392,
"grad_norm": 0.9940080046653748,
"learning_rate": 9.770437083326191e-05,
"loss": 1.8530050277709962,
"memory(GiB)": 118.24,
"step": 2680,
"token_acc": 0.5813813813813814,
"train_speed(iter/s)": 0.215329
},
{
"epoch": 1.0342835130970724,
"grad_norm": 2.6517465114593506,
"learning_rate": 9.759464144268268e-05,
"loss": 1.9058815002441407,
"memory(GiB)": 118.24,
"step": 2685,
"token_acc": 0.5872814796047631,
"train_speed(iter/s)": 0.215554
},
{
"epoch": 1.0362095531587057,
"grad_norm": 0.9095665812492371,
"learning_rate": 9.74847538356131e-05,
"loss": 1.8254484176635741,
"memory(GiB)": 118.24,
"step": 2690,
"token_acc": 0.5883097165991903,
"train_speed(iter/s)": 0.215478
},
{
"epoch": 1.0381355932203389,
"grad_norm": 0.6931060552597046,
"learning_rate": 9.737470850745731e-05,
"loss": 1.852724838256836,
"memory(GiB)": 118.24,
"step": 2695,
"token_acc": 0.5661989017693716,
"train_speed(iter/s)": 0.215705
},
{
"epoch": 1.0400616332819723,
"grad_norm": 0.8766068816184998,
"learning_rate": 9.726450595433054e-05,
"loss": 1.837939453125,
"memory(GiB)": 118.24,
"step": 2700,
"token_acc": 0.5932343234323433,
"train_speed(iter/s)": 0.215919
},
{
"epoch": 1.0419876733436055,
"grad_norm": 0.851811408996582,
"learning_rate": 9.715414667305676e-05,
"loss": 1.894862747192383,
"memory(GiB)": 118.24,
"step": 2705,
"token_acc": 0.5743899239044871,
"train_speed(iter/s)": 0.215611
},
{
"epoch": 1.0439137134052388,
"grad_norm": 0.9929028153419495,
"learning_rate": 9.704363116116664e-05,
"loss": 1.8359031677246094,
"memory(GiB)": 118.24,
"step": 2710,
"token_acc": 0.5987220447284345,
"train_speed(iter/s)": 0.215835
},
{
"epoch": 1.0458397534668722,
"grad_norm": 1.2110342979431152,
"learning_rate": 9.69329599168951e-05,
"loss": 1.882303810119629,
"memory(GiB)": 118.24,
"step": 2715,
"token_acc": 0.5893077112589308,
"train_speed(iter/s)": 0.216057
},
{
"epoch": 1.0477657935285054,
"grad_norm": 0.7954553961753845,
"learning_rate": 9.682213343917914e-05,
"loss": 1.8980537414550782,
"memory(GiB)": 118.24,
"step": 2720,
"token_acc": 0.5677123182861515,
"train_speed(iter/s)": 0.216238
},
{
"epoch": 1.0496918335901386,
"grad_norm": 0.8508651852607727,
"learning_rate": 9.671115222765564e-05,
"loss": 1.8639345169067383,
"memory(GiB)": 118.24,
"step": 2725,
"token_acc": 0.5630630630630631,
"train_speed(iter/s)": 0.216391
},
{
"epoch": 1.051617873651772,
"grad_norm": 1.146342396736145,
"learning_rate": 9.660001678265905e-05,
"loss": 1.8648239135742188,
"memory(GiB)": 118.24,
"step": 2730,
"token_acc": 0.5886489201406329,
"train_speed(iter/s)": 0.21647
},
{
"epoch": 1.0535439137134053,
"grad_norm": 7.731226444244385,
"learning_rate": 9.648872760521909e-05,
"loss": 1.8974201202392578,
"memory(GiB)": 118.24,
"step": 2735,
"token_acc": 0.5776738511590077,
"train_speed(iter/s)": 0.216688
},
{
"epoch": 1.0554699537750385,
"grad_norm": 1.080702304840088,
"learning_rate": 9.637728519705864e-05,
"loss": 1.8359441757202148,
"memory(GiB)": 118.24,
"step": 2740,
"token_acc": 0.5879754601226994,
"train_speed(iter/s)": 0.216693
},
{
"epoch": 1.0573959938366717,
"grad_norm": 0.6086855530738831,
"learning_rate": 9.626569006059135e-05,
"loss": 1.8823871612548828,
"memory(GiB)": 118.24,
"step": 2745,
"token_acc": 0.5659057437407953,
"train_speed(iter/s)": 0.216912
},
{
"epoch": 1.0593220338983051,
"grad_norm": 2.9040892124176025,
"learning_rate": 9.615394269891936e-05,
"loss": 1.916671371459961,
"memory(GiB)": 118.24,
"step": 2750,
"token_acc": 0.5639880952380952,
"train_speed(iter/s)": 0.217133
},
{
"epoch": 1.0612480739599384,
"grad_norm": 1.326704502105713,
"learning_rate": 9.604204361583117e-05,
"loss": 1.8886991500854493,
"memory(GiB)": 118.24,
"step": 2755,
"token_acc": 0.5787476280834914,
"train_speed(iter/s)": 0.217357
},
{
"epoch": 1.0631741140215716,
"grad_norm": 1.0250605344772339,
"learning_rate": 9.592999331579924e-05,
"loss": 1.8586359024047852,
"memory(GiB)": 118.24,
"step": 2760,
"token_acc": 0.5995157384987894,
"train_speed(iter/s)": 0.217578
},
{
"epoch": 1.065100154083205,
"grad_norm": 1.0501981973648071,
"learning_rate": 9.581779230397772e-05,
"loss": 1.8740936279296876,
"memory(GiB)": 118.24,
"step": 2765,
"token_acc": 0.5730209281164695,
"train_speed(iter/s)": 0.217476
},
{
"epoch": 1.0670261941448382,
"grad_norm": 0.7434837222099304,
"learning_rate": 9.570544108620033e-05,
"loss": 1.8510187149047852,
"memory(GiB)": 118.24,
"step": 2770,
"token_acc": 0.5614591593973037,
"train_speed(iter/s)": 0.217691
},
{
"epoch": 1.0689522342064715,
"grad_norm": 0.9832238554954529,
"learning_rate": 9.55929401689778e-05,
"loss": 1.8899845123291015,
"memory(GiB)": 118.24,
"step": 2775,
"token_acc": 0.5928844854762441,
"train_speed(iter/s)": 0.217658
},
{
"epoch": 1.0708782742681047,
"grad_norm": 0.890831470489502,
"learning_rate": 9.548029005949589e-05,
"loss": 1.8917844772338868,
"memory(GiB)": 118.24,
"step": 2780,
"token_acc": 0.5754400670578373,
"train_speed(iter/s)": 0.21786
},
{
"epoch": 1.072804314329738,
"grad_norm": 1.2053302526474,
"learning_rate": 9.536749126561286e-05,
"loss": 1.8872817993164062,
"memory(GiB)": 118.24,
"step": 2785,
"token_acc": 0.5819516816674561,
"train_speed(iter/s)": 0.217764
},
{
"epoch": 1.0747303543913713,
"grad_norm": 1.0404961109161377,
"learning_rate": 9.525454429585736e-05,
"loss": 1.9375843048095702,
"memory(GiB)": 118.24,
"step": 2790,
"token_acc": 0.5622685185185186,
"train_speed(iter/s)": 0.217979
},
{
"epoch": 1.0766563944530045,
"grad_norm": 0.8875176906585693,
"learning_rate": 9.514144965942599e-05,
"loss": 1.8680692672729493,
"memory(GiB)": 118.24,
"step": 2795,
"token_acc": 0.5834532374100719,
"train_speed(iter/s)": 0.218193
},
{
"epoch": 1.078582434514638,
"grad_norm": 1.6092698574066162,
"learning_rate": 9.502820786618111e-05,
"loss": 1.8898666381835938,
"memory(GiB)": 118.24,
"step": 2800,
"token_acc": 0.5776892430278885,
"train_speed(iter/s)": 0.218343
},
{
"epoch": 1.0805084745762712,
"grad_norm": 0.8939402103424072,
"learning_rate": 9.491481942664849e-05,
"loss": 1.869072723388672,
"memory(GiB)": 118.24,
"step": 2805,
"token_acc": 0.567577900974957,
"train_speed(iter/s)": 0.218545
},
{
"epoch": 1.0824345146379044,
"grad_norm": 0.9410150647163391,
"learning_rate": 9.480128485201505e-05,
"loss": 1.852294921875,
"memory(GiB)": 118.24,
"step": 2810,
"token_acc": 0.6026355803345159,
"train_speed(iter/s)": 0.21871
},
{
"epoch": 1.0843605546995378,
"grad_norm": 0.8424032926559448,
"learning_rate": 9.468760465412652e-05,
"loss": 1.8639339447021483,
"memory(GiB)": 118.24,
"step": 2815,
"token_acc": 0.569980694980695,
"train_speed(iter/s)": 0.218882
},
{
"epoch": 1.086286594761171,
"grad_norm": 0.6092885136604309,
"learning_rate": 9.457377934548507e-05,
"loss": 1.7856494903564453,
"memory(GiB)": 118.24,
"step": 2820,
"token_acc": 0.5842880523731587,
"train_speed(iter/s)": 0.219092
},
{
"epoch": 1.0882126348228043,
"grad_norm": 0.7894574403762817,
"learning_rate": 9.445980943924717e-05,
"loss": 1.9051006317138672,
"memory(GiB)": 118.24,
"step": 2825,
"token_acc": 0.5816425120772947,
"train_speed(iter/s)": 0.218839
},
{
"epoch": 1.0901386748844375,
"grad_norm": 1.060431718826294,
"learning_rate": 9.434569544922112e-05,
"loss": 1.8405721664428711,
"memory(GiB)": 118.24,
"step": 2830,
"token_acc": 0.5871559633027523,
"train_speed(iter/s)": 0.219048
},
{
"epoch": 1.092064714946071,
"grad_norm": 1.3697607517242432,
"learning_rate": 9.423143788986483e-05,
"loss": 1.8477794647216796,
"memory(GiB)": 118.24,
"step": 2835,
"token_acc": 0.583436087135224,
"train_speed(iter/s)": 0.218892
},
{
"epoch": 1.0939907550077042,
"grad_norm": 0.6515471339225769,
"learning_rate": 9.411703727628343e-05,
"loss": 1.8501924514770507,
"memory(GiB)": 118.24,
"step": 2840,
"token_acc": 0.5769669327251995,
"train_speed(iter/s)": 0.219104
},
{
"epoch": 1.0959167950693374,
"grad_norm": 1.0552825927734375,
"learning_rate": 9.400249412422693e-05,
"loss": 1.831197738647461,
"memory(GiB)": 118.24,
"step": 2845,
"token_acc": 0.5694606584169974,
"train_speed(iter/s)": 0.219168
},
{
"epoch": 1.0978428351309708,
"grad_norm": 0.6685405373573303,
"learning_rate": 9.388780895008809e-05,
"loss": 1.8796417236328125,
"memory(GiB)": 118.24,
"step": 2850,
"token_acc": 0.5924134419551935,
"train_speed(iter/s)": 0.219229
},
{
"epoch": 1.099768875192604,
"grad_norm": 0.920935869216919,
"learning_rate": 9.377298227089976e-05,
"loss": 1.877511978149414,
"memory(GiB)": 118.24,
"step": 2855,
"token_acc": 0.5651423641069888,
"train_speed(iter/s)": 0.219441
},
{
"epoch": 1.1016949152542372,
"grad_norm": 1.1936856508255005,
"learning_rate": 9.365801460433288e-05,
"loss": 1.8152345657348632,
"memory(GiB)": 118.24,
"step": 2860,
"token_acc": 0.5614118769377534,
"train_speed(iter/s)": 0.219653
},
{
"epoch": 1.1036209553158707,
"grad_norm": 1.0216765403747559,
"learning_rate": 9.354290646869395e-05,
"loss": 1.8699501037597657,
"memory(GiB)": 118.24,
"step": 2865,
"token_acc": 0.5882352941176471,
"train_speed(iter/s)": 0.219635
},
{
"epoch": 1.105546995377504,
"grad_norm": 0.9820363521575928,
"learning_rate": 9.342765838292274e-05,
"loss": 1.8355649948120116,
"memory(GiB)": 118.24,
"step": 2870,
"token_acc": 0.5686054345385133,
"train_speed(iter/s)": 0.219826
},
{
"epoch": 1.107473035439137,
"grad_norm": 1.0165764093399048,
"learning_rate": 9.331227086658993e-05,
"loss": 1.8532234191894532,
"memory(GiB)": 118.24,
"step": 2875,
"token_acc": 0.5907317073170731,
"train_speed(iter/s)": 0.219819
},
{
"epoch": 1.1093990755007703,
"grad_norm": 0.9640690088272095,
"learning_rate": 9.319674443989484e-05,
"loss": 1.8951274871826171,
"memory(GiB)": 118.24,
"step": 2880,
"token_acc": 0.5604702131898784,
"train_speed(iter/s)": 0.22003
},
{
"epoch": 1.1113251155624038,
"grad_norm": 1.0514110326766968,
"learning_rate": 9.308107962366301e-05,
"loss": 1.9084840774536134,
"memory(GiB)": 118.24,
"step": 2885,
"token_acc": 0.5889642962525818,
"train_speed(iter/s)": 0.219951
},
{
"epoch": 1.113251155624037,
"grad_norm": 1.5298981666564941,
"learning_rate": 9.29652769393439e-05,
"loss": 1.9044412612915038,
"memory(GiB)": 118.24,
"step": 2890,
"token_acc": 0.5630640083945435,
"train_speed(iter/s)": 0.220151
},
{
"epoch": 1.1151771956856702,
"grad_norm": 0.8108352422714233,
"learning_rate": 9.284933690900847e-05,
"loss": 1.8176475524902345,
"memory(GiB)": 118.24,
"step": 2895,
"token_acc": 0.579942242058283,
"train_speed(iter/s)": 0.220293
},
{
"epoch": 1.1171032357473036,
"grad_norm": 1.4489328861236572,
"learning_rate": 9.273326005534693e-05,
"loss": 1.844976806640625,
"memory(GiB)": 118.24,
"step": 2900,
"token_acc": 0.5795043882292205,
"train_speed(iter/s)": 0.220362
},
{
"epoch": 1.1190292758089369,
"grad_norm": 1.0090405941009521,
"learning_rate": 9.26170469016663e-05,
"loss": 1.8660137176513671,
"memory(GiB)": 118.24,
"step": 2905,
"token_acc": 0.5674379232505643,
"train_speed(iter/s)": 0.2204
},
{
"epoch": 1.12095531587057,
"grad_norm": 1.2113709449768066,
"learning_rate": 9.250069797188809e-05,
"loss": 1.9027469635009766,
"memory(GiB)": 118.24,
"step": 2910,
"token_acc": 0.5722858701582105,
"train_speed(iter/s)": 0.220482
},
{
"epoch": 1.1228813559322033,
"grad_norm": 0.8399081826210022,
"learning_rate": 9.238421379054591e-05,
"loss": 1.866159439086914,
"memory(GiB)": 118.24,
"step": 2915,
"token_acc": 0.5893015030946065,
"train_speed(iter/s)": 0.220694
},
{
"epoch": 1.1248073959938367,
"grad_norm": 0.8414112329483032,
"learning_rate": 9.226759488278315e-05,
"loss": 1.8603809356689454,
"memory(GiB)": 118.24,
"step": 2920,
"token_acc": 0.5744300402324541,
"train_speed(iter/s)": 0.220408
},
{
"epoch": 1.12673343605547,
"grad_norm": 1.120094895362854,
"learning_rate": 9.215084177435055e-05,
"loss": 1.8289287567138672,
"memory(GiB)": 118.24,
"step": 2925,
"token_acc": 0.5891046073601854,
"train_speed(iter/s)": 0.220612
},
{
"epoch": 1.1286594761171032,
"grad_norm": 1.9631211757659912,
"learning_rate": 9.203395499160385e-05,
"loss": 1.869622039794922,
"memory(GiB)": 118.24,
"step": 2930,
"token_acc": 0.5723039215686274,
"train_speed(iter/s)": 0.22082
},
{
"epoch": 1.1305855161787366,
"grad_norm": 0.8741260766983032,
"learning_rate": 9.191693506150153e-05,
"loss": 1.8904369354248047,
"memory(GiB)": 118.24,
"step": 2935,
"token_acc": 0.5756207674943566,
"train_speed(iter/s)": 0.220692
},
{
"epoch": 1.1325115562403698,
"grad_norm": 0.961950421333313,
"learning_rate": 9.179978251160223e-05,
"loss": 1.8798887252807617,
"memory(GiB)": 118.24,
"step": 2940,
"token_acc": 0.563659095644926,
"train_speed(iter/s)": 0.220896
},
{
"epoch": 1.134437596302003,
"grad_norm": 0.8654031753540039,
"learning_rate": 9.168249787006253e-05,
"loss": 1.9256160736083985,
"memory(GiB)": 118.24,
"step": 2945,
"token_acc": 0.5829567462879277,
"train_speed(iter/s)": 0.221098
},
{
"epoch": 1.1363636363636362,
"grad_norm": 0.8082730174064636,
"learning_rate": 9.156508166563447e-05,
"loss": 1.8584487915039063,
"memory(GiB)": 118.24,
"step": 2950,
"token_acc": 0.5865949119373777,
"train_speed(iter/s)": 0.221076
},
{
"epoch": 1.1382896764252697,
"grad_norm": 1.8858978748321533,
"learning_rate": 9.144753442766326e-05,
"loss": 1.880162811279297,
"memory(GiB)": 118.24,
"step": 2955,
"token_acc": 0.5858250276854928,
"train_speed(iter/s)": 0.22128
},
{
"epoch": 1.140215716486903,
"grad_norm": 1.3983076810836792,
"learning_rate": 9.132985668608487e-05,
"loss": 1.8480472564697266,
"memory(GiB)": 118.24,
"step": 2960,
"token_acc": 0.5732368896925859,
"train_speed(iter/s)": 0.221003
},
{
"epoch": 1.1421417565485361,
"grad_norm": 1.125353455543518,
"learning_rate": 9.121204897142352e-05,
"loss": 1.8179750442504883,
"memory(GiB)": 118.24,
"step": 2965,
"token_acc": 0.5801740211311374,
"train_speed(iter/s)": 0.221212
},
{
"epoch": 1.1440677966101696,
"grad_norm": 1.2973246574401855,
"learning_rate": 9.109411181478946e-05,
"loss": 1.9305080413818358,
"memory(GiB)": 118.24,
"step": 2970,
"token_acc": 0.5736081370449678,
"train_speed(iter/s)": 0.221026
},
{
"epoch": 1.1459938366718028,
"grad_norm": 1.136041283607483,
"learning_rate": 9.097604574787648e-05,
"loss": 1.8189834594726562,
"memory(GiB)": 118.24,
"step": 2975,
"token_acc": 0.5642458100558659,
"train_speed(iter/s)": 0.221228
},
{
"epoch": 1.147919876733436,
"grad_norm": 1.2743477821350098,
"learning_rate": 9.085785130295955e-05,
"loss": 1.892550277709961,
"memory(GiB)": 118.24,
"step": 2980,
"token_acc": 0.5596406935450178,
"train_speed(iter/s)": 0.221435
},
{
"epoch": 1.1498459167950694,
"grad_norm": 1.2965178489685059,
"learning_rate": 9.07395290128924e-05,
"loss": 1.8549304962158204,
"memory(GiB)": 118.24,
"step": 2985,
"token_acc": 0.5720962841785464,
"train_speed(iter/s)": 0.22112
},
{
"epoch": 1.1517719568567026,
"grad_norm": 0.9816954731941223,
"learning_rate": 9.062107941110509e-05,
"loss": 1.8125295639038086,
"memory(GiB)": 118.24,
"step": 2990,
"token_acc": 0.5752312203925107,
"train_speed(iter/s)": 0.221322
},
{
"epoch": 1.1536979969183359,
"grad_norm": 0.9750504493713379,
"learning_rate": 9.050250303160164e-05,
"loss": 1.817061424255371,
"memory(GiB)": 118.24,
"step": 2995,
"token_acc": 0.5753185111166625,
"train_speed(iter/s)": 0.221079
},
{
"epoch": 1.1556240369799693,
"grad_norm": 1.5480351448059082,
"learning_rate": 9.038380040895768e-05,
"loss": 1.8436656951904298,
"memory(GiB)": 118.24,
"step": 3000,
"token_acc": 0.5868163362789587,
"train_speed(iter/s)": 0.221277
},
{
"epoch": 1.1575500770416025,
"grad_norm": 0.8106587529182434,
"learning_rate": 9.026497207831792e-05,
"loss": 1.8772392272949219,
"memory(GiB)": 118.24,
"step": 3005,
"token_acc": 0.5850395850395851,
"train_speed(iter/s)": 0.221481
},
{
"epoch": 1.1594761171032357,
"grad_norm": 0.7256246209144592,
"learning_rate": 9.014601857539383e-05,
"loss": 1.8514884948730468,
"memory(GiB)": 118.24,
"step": 3010,
"token_acc": 0.5796740606609325,
"train_speed(iter/s)": 0.221547
},
{
"epoch": 1.161402157164869,
"grad_norm": 1.2435458898544312,
"learning_rate": 9.002694043646114e-05,
"loss": 1.8791698455810546,
"memory(GiB)": 118.24,
"step": 3015,
"token_acc": 0.5656286043829296,
"train_speed(iter/s)": 0.221751
},
{
"epoch": 1.1633281972265024,
"grad_norm": 0.9466080665588379,
"learning_rate": 8.990773819835754e-05,
"loss": 1.9109966278076171,
"memory(GiB)": 118.24,
"step": 3020,
"token_acc": 0.5880651945320715,
"train_speed(iter/s)": 0.221762
},
{
"epoch": 1.1652542372881356,
"grad_norm": 0.7421003580093384,
"learning_rate": 8.978841239848015e-05,
"loss": 1.8328750610351563,
"memory(GiB)": 118.24,
"step": 3025,
"token_acc": 0.5808431163287087,
"train_speed(iter/s)": 0.221963
},
{
"epoch": 1.1671802773497688,
"grad_norm": 1.3435719013214111,
"learning_rate": 8.966896357478319e-05,
"loss": 1.8882432937622071,
"memory(GiB)": 118.24,
"step": 3030,
"token_acc": 0.5630724396336386,
"train_speed(iter/s)": 0.221895
},
{
"epoch": 1.1691063174114023,
"grad_norm": 0.9989566802978516,
"learning_rate": 8.954939226577544e-05,
"loss": 1.871353530883789,
"memory(GiB)": 118.24,
"step": 3035,
"token_acc": 0.5589080459770115,
"train_speed(iter/s)": 0.2221
},
{
"epoch": 1.1710323574730355,
"grad_norm": 1.1358001232147217,
"learning_rate": 8.94296990105179e-05,
"loss": 1.8150867462158202,
"memory(GiB)": 118.24,
"step": 3040,
"token_acc": 0.5797297297297297,
"train_speed(iter/s)": 0.222303
},
{
"epoch": 1.1729583975346687,
"grad_norm": 0.890850305557251,
"learning_rate": 8.930988434862136e-05,
"loss": 1.8281471252441406,
"memory(GiB)": 118.24,
"step": 3045,
"token_acc": 0.5876861524783286,
"train_speed(iter/s)": 0.222266
},
{
"epoch": 1.174884437596302,
"grad_norm": 1.2370262145996094,
"learning_rate": 8.918994882024395e-05,
"loss": 1.8287195205688476,
"memory(GiB)": 118.24,
"step": 3050,
"token_acc": 0.5700222882615156,
"train_speed(iter/s)": 0.222459
},
{
"epoch": 1.1768104776579353,
"grad_norm": 1.085956335067749,
"learning_rate": 8.906989296608868e-05,
"loss": 1.8601539611816407,
"memory(GiB)": 118.24,
"step": 3055,
"token_acc": 0.5782970119074365,
"train_speed(iter/s)": 0.222433
},
{
"epoch": 1.1787365177195686,
"grad_norm": 0.8186383843421936,
"learning_rate": 8.894971732740099e-05,
"loss": 1.8926618576049805,
"memory(GiB)": 118.24,
"step": 3060,
"token_acc": 0.5794753086419753,
"train_speed(iter/s)": 0.22263
},
{
"epoch": 1.1806625577812018,
"grad_norm": 2.645453929901123,
"learning_rate": 8.882942244596642e-05,
"loss": 1.8511808395385743,
"memory(GiB)": 118.24,
"step": 3065,
"token_acc": 0.582378223495702,
"train_speed(iter/s)": 0.222751
},
{
"epoch": 1.1825885978428352,
"grad_norm": 1.095625638961792,
"learning_rate": 8.870900886410802e-05,
"loss": 1.808194351196289,
"memory(GiB)": 118.24,
"step": 3070,
"token_acc": 0.5716953724839178,
"train_speed(iter/s)": 0.22279
},
{
"epoch": 1.1845146379044684,
"grad_norm": 2.681864023208618,
"learning_rate": 8.858847712468403e-05,
"loss": 1.8524499893188477,
"memory(GiB)": 118.24,
"step": 3075,
"token_acc": 0.5653803748621831,
"train_speed(iter/s)": 0.222991
},
{
"epoch": 1.1864406779661016,
"grad_norm": 1.5897804498672485,
"learning_rate": 8.846782777108532e-05,
"loss": 1.8668397903442382,
"memory(GiB)": 118.24,
"step": 3080,
"token_acc": 0.5648094964579743,
"train_speed(iter/s)": 0.222841
},
{
"epoch": 1.1883667180277349,
"grad_norm": 0.9641701579093933,
"learning_rate": 8.834706134723305e-05,
"loss": 1.8878570556640626,
"memory(GiB)": 118.24,
"step": 3085,
"token_acc": 0.5698746748640341,
"train_speed(iter/s)": 0.223038
},
{
"epoch": 1.1902927580893683,
"grad_norm": 1.1126004457473755,
"learning_rate": 8.822617839757612e-05,
"loss": 1.8906505584716797,
"memory(GiB)": 118.24,
"step": 3090,
"token_acc": 0.5807913017215343,
"train_speed(iter/s)": 0.223049
},
{
"epoch": 1.1922187981510015,
"grad_norm": 1.2366658449172974,
"learning_rate": 8.810517946708882e-05,
"loss": 1.813461685180664,
"memory(GiB)": 118.24,
"step": 3095,
"token_acc": 0.583248987854251,
"train_speed(iter/s)": 0.223244
},
{
"epoch": 1.1941448382126347,
"grad_norm": 0.7631458640098572,
"learning_rate": 8.798406510126824e-05,
"loss": 1.8438899993896485,
"memory(GiB)": 118.24,
"step": 3100,
"token_acc": 0.5801459854014599,
"train_speed(iter/s)": 0.22344
},
{
"epoch": 1.1960708782742682,
"grad_norm": 1.4643558263778687,
"learning_rate": 8.786283584613194e-05,
"loss": 1.8446216583251953,
"memory(GiB)": 118.24,
"step": 3105,
"token_acc": 0.5754263226934849,
"train_speed(iter/s)": 0.223286
},
{
"epoch": 1.1979969183359014,
"grad_norm": 1.0200318098068237,
"learning_rate": 8.774149224821541e-05,
"loss": 1.7834148406982422,
"memory(GiB)": 118.24,
"step": 3110,
"token_acc": 0.589795402879515,
"train_speed(iter/s)": 0.223476
},
{
"epoch": 1.1999229583975346,
"grad_norm": 2.9114532470703125,
"learning_rate": 8.762003485456965e-05,
"loss": 1.8702865600585938,
"memory(GiB)": 118.24,
"step": 3115,
"token_acc": 0.5773822444106794,
"train_speed(iter/s)": 0.223401
},
{
"epoch": 1.201848998459168,
"grad_norm": 1.6492737531661987,
"learning_rate": 8.749846421275865e-05,
"loss": 1.8790077209472655,
"memory(GiB)": 118.24,
"step": 3120,
"token_acc": 0.5629596612435926,
"train_speed(iter/s)": 0.223598
},
{
"epoch": 1.2037750385208013,
"grad_norm": 0.7615155577659607,
"learning_rate": 8.737678087085699e-05,
"loss": 1.8393915176391602,
"memory(GiB)": 118.24,
"step": 3125,
"token_acc": 0.6077547339945897,
"train_speed(iter/s)": 0.223262
},
{
"epoch": 1.2057010785824345,
"grad_norm": 0.9724581241607666,
"learning_rate": 8.725498537744731e-05,
"loss": 1.8485027313232423,
"memory(GiB)": 118.24,
"step": 3130,
"token_acc": 0.5794111756459043,
"train_speed(iter/s)": 0.223452
},
{
"epoch": 1.207627118644068,
"grad_norm": 0.8728950023651123,
"learning_rate": 8.713307828161786e-05,
"loss": 1.856772232055664,
"memory(GiB)": 118.24,
"step": 3135,
"token_acc": 0.5716000685988681,
"train_speed(iter/s)": 0.223647
},
{
"epoch": 1.2095531587057011,
"grad_norm": 0.9881525635719299,
"learning_rate": 8.701106013296005e-05,
"loss": 1.8500242233276367,
"memory(GiB)": 118.24,
"step": 3140,
"token_acc": 0.5573841489822434,
"train_speed(iter/s)": 0.223356
},
{
"epoch": 1.2114791987673343,
"grad_norm": 1.1273807287216187,
"learning_rate": 8.68889314815659e-05,
"loss": 1.8441329956054688,
"memory(GiB)": 118.24,
"step": 3145,
"token_acc": 0.5582089552238806,
"train_speed(iter/s)": 0.223549
},
{
"epoch": 1.2134052388289676,
"grad_norm": 0.8422824144363403,
"learning_rate": 8.676669287802565e-05,
"loss": 1.8579490661621094,
"memory(GiB)": 118.24,
"step": 3150,
"token_acc": 0.5595683770094693,
"train_speed(iter/s)": 0.223431
},
{
"epoch": 1.215331278890601,
"grad_norm": 1.3149006366729736,
"learning_rate": 8.664434487342527e-05,
"loss": 1.8522964477539063,
"memory(GiB)": 118.24,
"step": 3155,
"token_acc": 0.570446735395189,
"train_speed(iter/s)": 0.223626
},
{
"epoch": 1.2172573189522342,
"grad_norm": 0.627025842666626,
"learning_rate": 8.652188801934383e-05,
"loss": 1.864504623413086,
"memory(GiB)": 118.24,
"step": 3160,
"token_acc": 0.5655122305643013,
"train_speed(iter/s)": 0.223821
},
{
"epoch": 1.2191833590138674,
"grad_norm": 1.0293751955032349,
"learning_rate": 8.639932286785119e-05,
"loss": 1.8348306655883788,
"memory(GiB)": 118.24,
"step": 3165,
"token_acc": 0.5644485807352256,
"train_speed(iter/s)": 0.223785
},
{
"epoch": 1.2211093990755009,
"grad_norm": 1.1320598125457764,
"learning_rate": 8.627664997150548e-05,
"loss": 1.8503002166748046,
"memory(GiB)": 118.24,
"step": 3170,
"token_acc": 0.5802525832376578,
"train_speed(iter/s)": 0.223978
},
{
"epoch": 1.223035439137134,
"grad_norm": 1.042977213859558,
"learning_rate": 8.61538698833505e-05,
"loss": 1.8537403106689454,
"memory(GiB)": 118.24,
"step": 3175,
"token_acc": 0.5747868172389952,
"train_speed(iter/s)": 0.223844
},
{
"epoch": 1.2249614791987673,
"grad_norm": 1.134169340133667,
"learning_rate": 8.603098315691337e-05,
"loss": 1.8022125244140625,
"memory(GiB)": 118.24,
"step": 3180,
"token_acc": 0.5909769943232746,
"train_speed(iter/s)": 0.224032
},
{
"epoch": 1.2268875192604005,
"grad_norm": 0.7309772372245789,
"learning_rate": 8.590799034620191e-05,
"loss": 1.8356678009033203,
"memory(GiB)": 118.24,
"step": 3185,
"token_acc": 0.5786475105276195,
"train_speed(iter/s)": 0.22404
},
{
"epoch": 1.228813559322034,
"grad_norm": 0.8766815066337585,
"learning_rate": 8.57848920057022e-05,
"loss": 1.856044387817383,
"memory(GiB)": 118.24,
"step": 3190,
"token_acc": 0.5844271412680756,
"train_speed(iter/s)": 0.224106
},
{
"epoch": 1.2307395993836672,
"grad_norm": 1.5134860277175903,
"learning_rate": 8.566168869037614e-05,
"loss": 1.8417312622070312,
"memory(GiB)": 118.24,
"step": 3195,
"token_acc": 0.5687395758875388,
"train_speed(iter/s)": 0.224027
},
{
"epoch": 1.2326656394453004,
"grad_norm": 1.8685661554336548,
"learning_rate": 8.553838095565883e-05,
"loss": 1.8797491073608399,
"memory(GiB)": 118.24,
"step": 3200,
"token_acc": 0.5593988058472308,
"train_speed(iter/s)": 0.224212
},
{
"epoch": 1.2345916795069338,
"grad_norm": 2.2050652503967285,
"learning_rate": 8.541496935745613e-05,
"loss": 1.8161453247070312,
"memory(GiB)": 118.24,
"step": 3205,
"token_acc": 0.5730733082706767,
"train_speed(iter/s)": 0.224082
},
{
"epoch": 1.236517719568567,
"grad_norm": 0.7844215035438538,
"learning_rate": 8.529145445214213e-05,
"loss": 1.8313411712646483,
"memory(GiB)": 118.24,
"step": 3210,
"token_acc": 0.5796633617708093,
"train_speed(iter/s)": 0.224217
},
{
"epoch": 1.2384437596302003,
"grad_norm": 1.1738195419311523,
"learning_rate": 8.516783679655671e-05,
"loss": 1.8096988677978516,
"memory(GiB)": 118.24,
"step": 3215,
"token_acc": 0.5807476178841925,
"train_speed(iter/s)": 0.223872
},
{
"epoch": 1.2403697996918335,
"grad_norm": 1.4127227067947388,
"learning_rate": 8.504411694800294e-05,
"loss": 1.8220989227294921,
"memory(GiB)": 118.24,
"step": 3220,
"token_acc": 0.5868175110673881,
"train_speed(iter/s)": 0.224058
},
{
"epoch": 1.242295839753467,
"grad_norm": 1.0065556764602661,
"learning_rate": 8.492029546424462e-05,
"loss": 1.828787612915039,
"memory(GiB)": 118.24,
"step": 3225,
"token_acc": 0.5677614194035485,
"train_speed(iter/s)": 0.224245
},
{
"epoch": 1.2442218798151001,
"grad_norm": 0.7304002642631531,
"learning_rate": 8.47963729035037e-05,
"loss": 1.8517780303955078,
"memory(GiB)": 118.24,
"step": 3230,
"token_acc": 0.5659461843846493,
"train_speed(iter/s)": 0.223844
},
{
"epoch": 1.2461479198767333,
"grad_norm": 1.2463603019714355,
"learning_rate": 8.46723498244579e-05,
"loss": 1.821853256225586,
"memory(GiB)": 118.24,
"step": 3235,
"token_acc": 0.5812310797174571,
"train_speed(iter/s)": 0.22403
},
{
"epoch": 1.2480739599383668,
"grad_norm": 1.53412663936615,
"learning_rate": 8.454822678623803e-05,
"loss": 1.86295166015625,
"memory(GiB)": 118.24,
"step": 3240,
"token_acc": 0.5861274635270028,
"train_speed(iter/s)": 0.223644
},
{
"epoch": 1.25,
"grad_norm": 0.7859674692153931,
"learning_rate": 8.442400434842557e-05,
"loss": 1.839095687866211,
"memory(GiB)": 118.24,
"step": 3245,
"token_acc": 0.5497198879551821,
"train_speed(iter/s)": 0.223827
},
{
"epoch": 1.2519260400616332,
"grad_norm": 1.0808963775634766,
"learning_rate": 8.429968307105014e-05,
"loss": 1.8195180892944336,
"memory(GiB)": 118.24,
"step": 3250,
"token_acc": 0.5808022258288894,
"train_speed(iter/s)": 0.223724
},
{
"epoch": 1.2538520801232664,
"grad_norm": 0.9158240556716919,
"learning_rate": 8.417526351458694e-05,
"loss": 1.8539520263671876,
"memory(GiB)": 118.24,
"step": 3255,
"token_acc": 0.5771712158808933,
"train_speed(iter/s)": 0.223914
},
{
"epoch": 1.2557781201848999,
"grad_norm": 0.76888507604599,
"learning_rate": 8.405074623995424e-05,
"loss": 1.8630853652954102,
"memory(GiB)": 118.24,
"step": 3260,
"token_acc": 0.5708838043965904,
"train_speed(iter/s)": 0.224102
},
{
"epoch": 1.257704160246533,
"grad_norm": 0.9579616785049438,
"learning_rate": 8.392613180851082e-05,
"loss": 1.803414535522461,
"memory(GiB)": 118.24,
"step": 3265,
"token_acc": 0.5825285338015803,
"train_speed(iter/s)": 0.224032
},
{
"epoch": 1.2596302003081665,
"grad_norm": 1.0696918964385986,
"learning_rate": 8.380142078205355e-05,
"loss": 1.821596908569336,
"memory(GiB)": 118.24,
"step": 3270,
"token_acc": 0.5844785772029103,
"train_speed(iter/s)": 0.224212
},
{
"epoch": 1.2615562403697997,
"grad_norm": 0.9113172292709351,
"learning_rate": 8.367661372281469e-05,
"loss": 1.8017152786254882,
"memory(GiB)": 118.24,
"step": 3275,
"token_acc": 0.5840116885827593,
"train_speed(iter/s)": 0.224053
},
{
"epoch": 1.263482280431433,
"grad_norm": 0.9522203207015991,
"learning_rate": 8.35517111934595e-05,
"loss": 1.7981292724609375,
"memory(GiB)": 118.24,
"step": 3280,
"token_acc": 0.5719459198454853,
"train_speed(iter/s)": 0.224241
},
{
"epoch": 1.2654083204930662,
"grad_norm": 1.0223705768585205,
"learning_rate": 8.342671375708364e-05,
"loss": 1.816117286682129,
"memory(GiB)": 118.24,
"step": 3285,
"token_acc": 0.5777317145395321,
"train_speed(iter/s)": 0.224425
},
{
"epoch": 1.2673343605546996,
"grad_norm": 0.9167478680610657,
"learning_rate": 8.330162197721059e-05,
"loss": 1.8301067352294922,
"memory(GiB)": 118.24,
"step": 3290,
"token_acc": 0.5863420672580978,
"train_speed(iter/s)": 0.224384
},
{
"epoch": 1.2692604006163328,
"grad_norm": 1.276617407798767,
"learning_rate": 8.317643641778919e-05,
"loss": 1.870458984375,
"memory(GiB)": 118.24,
"step": 3295,
"token_acc": 0.5766210455463316,
"train_speed(iter/s)": 0.224569
},
{
"epoch": 1.271186440677966,
"grad_norm": 0.8517452478408813,
"learning_rate": 8.30511576431911e-05,
"loss": 1.8094181060791015,
"memory(GiB)": 118.24,
"step": 3300,
"token_acc": 0.5764476252439817,
"train_speed(iter/s)": 0.224404
},
{
"epoch": 1.2731124807395995,
"grad_norm": 0.8477849364280701,
"learning_rate": 8.292578621820818e-05,
"loss": 1.7702598571777344,
"memory(GiB)": 118.24,
"step": 3305,
"token_acc": 0.5919067215363512,
"train_speed(iter/s)": 0.224578
},
{
"epoch": 1.2750385208012327,
"grad_norm": 0.9045779705047607,
"learning_rate": 8.280032270804996e-05,
"loss": 1.8854120254516602,
"memory(GiB)": 118.24,
"step": 3310,
"token_acc": 0.5799006719252118,
"train_speed(iter/s)": 0.224444
},
{
"epoch": 1.276964560862866,
"grad_norm": 1.2493846416473389,
"learning_rate": 8.267476767834117e-05,
"loss": 1.8361167907714844,
"memory(GiB)": 118.24,
"step": 3315,
"token_acc": 0.5765091249415067,
"train_speed(iter/s)": 0.224539
},
{
"epoch": 1.2788906009244991,
"grad_norm": 0.8523443341255188,
"learning_rate": 8.254912169511914e-05,
"loss": 1.7843673706054688,
"memory(GiB)": 118.24,
"step": 3320,
"token_acc": 0.6026341948310139,
"train_speed(iter/s)": 0.224724
},
{
"epoch": 1.2808166409861326,
"grad_norm": 0.8983572125434875,
"learning_rate": 8.242338532483114e-05,
"loss": 1.8341567993164063,
"memory(GiB)": 118.24,
"step": 3325,
"token_acc": 0.5868520859671302,
"train_speed(iter/s)": 0.224374
},
{
"epoch": 1.2827426810477658,
"grad_norm": 0.8013198375701904,
"learning_rate": 8.22975591343321e-05,
"loss": 1.8846923828125,
"memory(GiB)": 118.24,
"step": 3330,
"token_acc": 0.569195136074117,
"train_speed(iter/s)": 0.224419
},
{
"epoch": 1.284668721109399,
"grad_norm": 1.0531998872756958,
"learning_rate": 8.21716436908817e-05,
"loss": 1.817266082763672,
"memory(GiB)": 118.24,
"step": 3335,
"token_acc": 0.6099484379739157,
"train_speed(iter/s)": 0.224314
},
{
"epoch": 1.2865947611710324,
"grad_norm": 1.8000037670135498,
"learning_rate": 8.204563956214213e-05,
"loss": 1.8082931518554688,
"memory(GiB)": 118.24,
"step": 3340,
"token_acc": 0.5846994535519126,
"train_speed(iter/s)": 0.224492
},
{
"epoch": 1.2885208012326657,
"grad_norm": 0.9103190302848816,
"learning_rate": 8.191954731617539e-05,
"loss": 1.818209457397461,
"memory(GiB)": 118.24,
"step": 3345,
"token_acc": 0.5838716399249844,
"train_speed(iter/s)": 0.22467
},
{
"epoch": 1.2904468412942989,
"grad_norm": 1.2308526039123535,
"learning_rate": 8.179336752144064e-05,
"loss": 1.7933704376220703,
"memory(GiB)": 118.24,
"step": 3350,
"token_acc": 0.5789212030822769,
"train_speed(iter/s)": 0.224667
},
{
"epoch": 1.292372881355932,
"grad_norm": 0.7987526655197144,
"learning_rate": 8.166710074679183e-05,
"loss": 1.793991470336914,
"memory(GiB)": 118.24,
"step": 3355,
"token_acc": 0.6015644713600807,
"train_speed(iter/s)": 0.224642
},
{
"epoch": 1.2942989214175655,
"grad_norm": 0.7937904000282288,
"learning_rate": 8.1540747561475e-05,
"loss": 1.7964553833007812,
"memory(GiB)": 118.24,
"step": 3360,
"token_acc": 0.5679081489778773,
"train_speed(iter/s)": 0.224515
},
{
"epoch": 1.2962249614791987,
"grad_norm": 1.6171221733093262,
"learning_rate": 8.141430853512577e-05,
"loss": 1.8486566543579102,
"memory(GiB)": 118.24,
"step": 3365,
"token_acc": 0.5678276810265811,
"train_speed(iter/s)": 0.224411
},
{
"epoch": 1.2981510015408322,
"grad_norm": 2.2579948902130127,
"learning_rate": 8.128778423776675e-05,
"loss": 1.801005744934082,
"memory(GiB)": 118.24,
"step": 3370,
"token_acc": 0.5769160750045512,
"train_speed(iter/s)": 0.22434
},
{
"epoch": 1.3000770416024654,
"grad_norm": 1.528611421585083,
"learning_rate": 8.116117523980496e-05,
"loss": 1.8592164993286133,
"memory(GiB)": 118.24,
"step": 3375,
"token_acc": 0.5700712589073634,
"train_speed(iter/s)": 0.224519
},
{
"epoch": 1.3020030816640986,
"grad_norm": 0.7972738146781921,
"learning_rate": 8.103448211202928e-05,
"loss": 1.8083702087402345,
"memory(GiB)": 118.24,
"step": 3380,
"token_acc": 0.5807228915662651,
"train_speed(iter/s)": 0.224567
},
{
"epoch": 1.3039291217257318,
"grad_norm": 2.7372536659240723,
"learning_rate": 8.090770542560789e-05,
"loss": 1.8603469848632812,
"memory(GiB)": 118.24,
"step": 3385,
"token_acc": 0.5610678999369351,
"train_speed(iter/s)": 0.224324
},
{
"epoch": 1.305855161787365,
"grad_norm": 0.8049010038375854,
"learning_rate": 8.078084575208567e-05,
"loss": 1.8244970321655274,
"memory(GiB)": 118.24,
"step": 3390,
"token_acc": 0.5591511936339523,
"train_speed(iter/s)": 0.224503
},
{
"epoch": 1.3077812018489985,
"grad_norm": 1.2021806240081787,
"learning_rate": 8.065390366338163e-05,
"loss": 1.8759939193725585,
"memory(GiB)": 118.24,
"step": 3395,
"token_acc": 0.5740784221648274,
"train_speed(iter/s)": 0.224182
},
{
"epoch": 1.3097072419106317,
"grad_norm": 1.3137462139129639,
"learning_rate": 8.052687973178627e-05,
"loss": 1.836330032348633,
"memory(GiB)": 118.24,
"step": 3400,
"token_acc": 0.57466732380483,
"train_speed(iter/s)": 0.224363
},
{
"epoch": 1.3116332819722651,
"grad_norm": 0.8630958199501038,
"learning_rate": 8.039977452995917e-05,
"loss": 1.829033660888672,
"memory(GiB)": 118.24,
"step": 3405,
"token_acc": 0.5744279311158292,
"train_speed(iter/s)": 0.22454
},
{
"epoch": 1.3135593220338984,
"grad_norm": 0.9817216396331787,
"learning_rate": 8.027258863092622e-05,
"loss": 1.8231685638427735,
"memory(GiB)": 118.24,
"step": 3410,
"token_acc": 0.5717054263565892,
"train_speed(iter/s)": 0.224131
},
{
"epoch": 1.3154853620955316,
"grad_norm": 0.7684584259986877,
"learning_rate": 8.014532260807713e-05,
"loss": 1.821477508544922,
"memory(GiB)": 118.24,
"step": 3415,
"token_acc": 0.5776882397381012,
"train_speed(iter/s)": 0.224309
},
{
"epoch": 1.3174114021571648,
"grad_norm": 1.0724796056747437,
"learning_rate": 8.001797703516286e-05,
"loss": 1.8452959060668945,
"memory(GiB)": 118.24,
"step": 3420,
"token_acc": 0.5700459714493105,
"train_speed(iter/s)": 0.224042
},
{
"epoch": 1.3193374422187982,
"grad_norm": 1.0265575647354126,
"learning_rate": 7.989055248629298e-05,
"loss": 1.8105331420898438,
"memory(GiB)": 118.24,
"step": 3425,
"token_acc": 0.5692111959287531,
"train_speed(iter/s)": 0.22422
},
{
"epoch": 1.3212634822804314,
"grad_norm": 1.1323086023330688,
"learning_rate": 7.97630495359331e-05,
"loss": 1.8532070159912108,
"memory(GiB)": 118.24,
"step": 3430,
"token_acc": 0.5917520741825281,
"train_speed(iter/s)": 0.224006
},
{
"epoch": 1.3231895223420647,
"grad_norm": 0.768324077129364,
"learning_rate": 7.963546875890228e-05,
"loss": 1.8037132263183593,
"memory(GiB)": 118.24,
"step": 3435,
"token_acc": 0.5945297504798465,
"train_speed(iter/s)": 0.224184
},
{
"epoch": 1.325115562403698,
"grad_norm": 0.9906430244445801,
"learning_rate": 7.950781073037049e-05,
"loss": 1.865304183959961,
"memory(GiB)": 118.24,
"step": 3440,
"token_acc": 0.5786896712520401,
"train_speed(iter/s)": 0.22436
},
{
"epoch": 1.3270416024653313,
"grad_norm": 1.069547176361084,
"learning_rate": 7.938007602585591e-05,
"loss": 1.8258533477783203,
"memory(GiB)": 118.24,
"step": 3445,
"token_acc": 0.5560128029263832,
"train_speed(iter/s)": 0.224217
},
{
"epoch": 1.3289676425269645,
"grad_norm": 0.8275343179702759,
"learning_rate": 7.925226522122246e-05,
"loss": 1.7918359756469726,
"memory(GiB)": 118.24,
"step": 3450,
"token_acc": 0.6055412068560695,
"train_speed(iter/s)": 0.224389
},
{
"epoch": 1.3308936825885977,
"grad_norm": 1.1620420217514038,
"learning_rate": 7.912437889267708e-05,
"loss": 1.8342025756835938,
"memory(GiB)": 118.24,
"step": 3455,
"token_acc": 0.5751736500112032,
"train_speed(iter/s)": 0.224161
},
{
"epoch": 1.3328197226502312,
"grad_norm": 0.6291630268096924,
"learning_rate": 7.899641761676723e-05,
"loss": 1.8314617156982422,
"memory(GiB)": 118.24,
"step": 3460,
"token_acc": 0.5737434770667399,
"train_speed(iter/s)": 0.224341
},
{
"epoch": 1.3347457627118644,
"grad_norm": 1.1161185503005981,
"learning_rate": 7.886838197037825e-05,
"loss": 1.8586105346679687,
"memory(GiB)": 118.24,
"step": 3465,
"token_acc": 0.590559261159569,
"train_speed(iter/s)": 0.224514
},
{
"epoch": 1.3366718027734976,
"grad_norm": 1.0682084560394287,
"learning_rate": 7.874027253073077e-05,
"loss": 1.9026851654052734,
"memory(GiB)": 118.24,
"step": 3470,
"token_acc": 0.5668541756815232,
"train_speed(iter/s)": 0.224345
},
{
"epoch": 1.338597842835131,
"grad_norm": 0.7407890558242798,
"learning_rate": 7.861208987537804e-05,
"loss": 1.8539093017578125,
"memory(GiB)": 118.24,
"step": 3475,
"token_acc": 0.5772066148635187,
"train_speed(iter/s)": 0.224519
},
{
"epoch": 1.3405238828967643,
"grad_norm": 1.523796558380127,
"learning_rate": 7.84838345822035e-05,
"loss": 1.7979095458984375,
"memory(GiB)": 118.24,
"step": 3480,
"token_acc": 0.5945652173913043,
"train_speed(iter/s)": 0.224201
},
{
"epoch": 1.3424499229583975,
"grad_norm": 1.1976600885391235,
"learning_rate": 7.835550722941795e-05,
"loss": 1.8510868072509765,
"memory(GiB)": 118.24,
"step": 3485,
"token_acc": 0.5923408112395196,
"train_speed(iter/s)": 0.22437
},
{
"epoch": 1.3443759630200307,
"grad_norm": 2.799816608428955,
"learning_rate": 7.822710839555713e-05,
"loss": 1.8664752960205078,
"memory(GiB)": 118.24,
"step": 3490,
"token_acc": 0.5889204545454545,
"train_speed(iter/s)": 0.224072
},
{
"epoch": 1.3463020030816641,
"grad_norm": 6.8079023361206055,
"learning_rate": 7.809863865947899e-05,
"loss": 1.822733497619629,
"memory(GiB)": 118.24,
"step": 3495,
"token_acc": 0.5768054575394025,
"train_speed(iter/s)": 0.224248
},
{
"epoch": 1.3482280431432974,
"grad_norm": 1.1376867294311523,
"learning_rate": 7.797009860036114e-05,
"loss": 1.8381580352783202,
"memory(GiB)": 118.24,
"step": 3500,
"token_acc": 0.5807765408634266,
"train_speed(iter/s)": 0.224419
},
{
"epoch": 1.3501540832049308,
"grad_norm": 0.751111626625061,
"learning_rate": 7.784148879769826e-05,
"loss": 1.8117263793945313,
"memory(GiB)": 118.24,
"step": 3505,
"token_acc": 0.5783826223501701,
"train_speed(iter/s)": 0.224158
},
{
"epoch": 1.352080123266564,
"grad_norm": 1.092025876045227,
"learning_rate": 7.771280983129938e-05,
"loss": 1.8256870269775392,
"memory(GiB)": 118.24,
"step": 3510,
"token_acc": 0.5822851153039832,
"train_speed(iter/s)": 0.224326
},
{
"epoch": 1.3540061633281972,
"grad_norm": 0.7541021704673767,
"learning_rate": 7.758406228128547e-05,
"loss": 1.8215415954589844,
"memory(GiB)": 118.24,
"step": 3515,
"token_acc": 0.5863351150360214,
"train_speed(iter/s)": 0.224019
},
{
"epoch": 1.3559322033898304,
"grad_norm": 1.833341360092163,
"learning_rate": 7.745524672808651e-05,
"loss": 1.824519157409668,
"memory(GiB)": 118.24,
"step": 3520,
"token_acc": 0.5911068148864186,
"train_speed(iter/s)": 0.224193
},
{
"epoch": 1.3578582434514637,
"grad_norm": 2.483410358428955,
"learning_rate": 7.732636375243922e-05,
"loss": 1.8503372192382812,
"memory(GiB)": 118.24,
"step": 3525,
"token_acc": 0.5966494845360825,
"train_speed(iter/s)": 0.224367
},
{
"epoch": 1.359784283513097,
"grad_norm": 1.4958441257476807,
"learning_rate": 7.719741393538418e-05,
"loss": 1.825875473022461,
"memory(GiB)": 118.24,
"step": 3530,
"token_acc": 0.5801710901513489,
"train_speed(iter/s)": 0.224068
},
{
"epoch": 1.3617103235747303,
"grad_norm": 1.3598182201385498,
"learning_rate": 7.706839785826336e-05,
"loss": 1.8679914474487305,
"memory(GiB)": 118.24,
"step": 3535,
"token_acc": 0.5606219794074385,
"train_speed(iter/s)": 0.224239
},
{
"epoch": 1.3636363636363638,
"grad_norm": 1.0903713703155518,
"learning_rate": 7.693931610271746e-05,
"loss": 1.809415626525879,
"memory(GiB)": 118.24,
"step": 3540,
"token_acc": 0.5881499395405079,
"train_speed(iter/s)": 0.223918
},
{
"epoch": 1.365562403697997,
"grad_norm": 1.1144036054611206,
"learning_rate": 7.681016925068323e-05,
"loss": 1.8281490325927734,
"memory(GiB)": 118.24,
"step": 3545,
"token_acc": 0.5709703287890938,
"train_speed(iter/s)": 0.224085
},
{
"epoch": 1.3674884437596302,
"grad_norm": 0.9303693175315857,
"learning_rate": 7.668095788439087e-05,
"loss": 1.8484193801879882,
"memory(GiB)": 118.24,
"step": 3550,
"token_acc": 0.5805003207184093,
"train_speed(iter/s)": 0.223815
},
{
"epoch": 1.3694144838212634,
"grad_norm": 1.2538106441497803,
"learning_rate": 7.655168258636154e-05,
"loss": 1.8071859359741211,
"memory(GiB)": 118.24,
"step": 3555,
"token_acc": 0.5666938331975007,
"train_speed(iter/s)": 0.22399
},
{
"epoch": 1.3713405238828968,
"grad_norm": 1.1651560068130493,
"learning_rate": 7.642234393940453e-05,
"loss": 1.7916452407836914,
"memory(GiB)": 118.24,
"step": 3560,
"token_acc": 0.6053254437869823,
"train_speed(iter/s)": 0.22416
},
{
"epoch": 1.37326656394453,
"grad_norm": 1.2316945791244507,
"learning_rate": 7.629294252661477e-05,
"loss": 1.842620277404785,
"memory(GiB)": 118.24,
"step": 3565,
"token_acc": 0.5796603701583667,
"train_speed(iter/s)": 0.223916
},
{
"epoch": 1.3751926040061633,
"grad_norm": 0.6773806810379028,
"learning_rate": 7.616347893137009e-05,
"loss": 1.8143430709838868,
"memory(GiB)": 118.24,
"step": 3570,
"token_acc": 0.578386605783866,
"train_speed(iter/s)": 0.224086
},
{
"epoch": 1.3771186440677967,
"grad_norm": 0.8631386160850525,
"learning_rate": 7.603395373732875e-05,
"loss": 1.7666091918945312,
"memory(GiB)": 118.24,
"step": 3575,
"token_acc": 0.5911386593204775,
"train_speed(iter/s)": 0.223819
},
{
"epoch": 1.37904468412943,
"grad_norm": 0.6786922216415405,
"learning_rate": 7.590436752842662e-05,
"loss": 1.8526723861694336,
"memory(GiB)": 118.24,
"step": 3580,
"token_acc": 0.6015222194942303,
"train_speed(iter/s)": 0.223991
},
{
"epoch": 1.3809707241910631,
"grad_norm": 0.79050612449646,
"learning_rate": 7.577472088887473e-05,
"loss": 1.8294553756713867,
"memory(GiB)": 118.24,
"step": 3585,
"token_acc": 0.5710337202874516,
"train_speed(iter/s)": 0.224163
},
{
"epoch": 1.3828967642526964,
"grad_norm": 0.5673639178276062,
"learning_rate": 7.564501440315648e-05,
"loss": 1.8349960327148438,
"memory(GiB)": 118.24,
"step": 3590,
"token_acc": 0.5788113695090439,
"train_speed(iter/s)": 0.223792
},
{
"epoch": 1.3848228043143298,
"grad_norm": 0.7228362560272217,
"learning_rate": 7.551524865602512e-05,
"loss": 1.7876060485839844,
"memory(GiB)": 118.24,
"step": 3595,
"token_acc": 0.5683976560921399,
"train_speed(iter/s)": 0.223964
},
{
"epoch": 1.386748844375963,
"grad_norm": 0.9439152479171753,
"learning_rate": 7.538542423250104e-05,
"loss": 1.8183494567871095,
"memory(GiB)": 118.24,
"step": 3600,
"token_acc": 0.5827472072817542,
"train_speed(iter/s)": 0.223706
},
{
"epoch": 1.3886748844375962,
"grad_norm": 1.1151697635650635,
"learning_rate": 7.525554171786915e-05,
"loss": 1.8112590789794922,
"memory(GiB)": 118.24,
"step": 3605,
"token_acc": 0.5951767735893233,
"train_speed(iter/s)": 0.223872
},
{
"epoch": 1.3906009244992297,
"grad_norm": 0.9838011264801025,
"learning_rate": 7.51256016976763e-05,
"loss": 1.837855911254883,
"memory(GiB)": 118.24,
"step": 3610,
"token_acc": 0.5710779300470444,
"train_speed(iter/s)": 0.22358
},
{
"epoch": 1.392526964560863,
"grad_norm": 1.9302595853805542,
"learning_rate": 7.499560475772852e-05,
"loss": 1.8453802108764648,
"memory(GiB)": 118.24,
"step": 3615,
"token_acc": 0.5730688935281837,
"train_speed(iter/s)": 0.223745
},
{
"epoch": 1.394453004622496,
"grad_norm": 1.1173580884933472,
"learning_rate": 7.486555148408853e-05,
"loss": 1.8429244995117187,
"memory(GiB)": 118.24,
"step": 3620,
"token_acc": 0.5922043010752688,
"train_speed(iter/s)": 0.223912
},
{
"epoch": 1.3963790446841293,
"grad_norm": 0.8065545558929443,
"learning_rate": 7.473544246307297e-05,
"loss": 1.8583301544189452,
"memory(GiB)": 118.24,
"step": 3625,
"token_acc": 0.5653939886271324,
"train_speed(iter/s)": 0.223769
},
{
"epoch": 1.3983050847457628,
"grad_norm": 1.9409068822860718,
"learning_rate": 7.460527828124979e-05,
"loss": 1.7476036071777343,
"memory(GiB)": 118.24,
"step": 3630,
"token_acc": 0.5707927087749046,
"train_speed(iter/s)": 0.223937
},
{
"epoch": 1.400231124807396,
"grad_norm": 1.1709771156311035,
"learning_rate": 7.447505952543565e-05,
"loss": 1.793610191345215,
"memory(GiB)": 118.24,
"step": 3635,
"token_acc": 0.588042970574498,
"train_speed(iter/s)": 0.223667
},
{
"epoch": 1.4021571648690292,
"grad_norm": 0.6994560360908508,
"learning_rate": 7.434478678269324e-05,
"loss": 1.7944747924804687,
"memory(GiB)": 118.24,
"step": 3640,
"token_acc": 0.5730129390018485,
"train_speed(iter/s)": 0.223834
},
{
"epoch": 1.4040832049306626,
"grad_norm": 1.1161283254623413,
"learning_rate": 7.421446064032865e-05,
"loss": 1.8786045074462892,
"memory(GiB)": 118.24,
"step": 3645,
"token_acc": 0.5576496674057649,
"train_speed(iter/s)": 0.224002
},
{
"epoch": 1.4060092449922958,
"grad_norm": 0.9730678200721741,
"learning_rate": 7.408408168588868e-05,
"loss": 1.8084569931030274,
"memory(GiB)": 118.24,
"step": 3650,
"token_acc": 0.616824644549763,
"train_speed(iter/s)": 0.223751
},
{
"epoch": 1.407935285053929,
"grad_norm": 0.6398198008537292,
"learning_rate": 7.395365050715823e-05,
"loss": 1.834469985961914,
"memory(GiB)": 118.24,
"step": 3655,
"token_acc": 0.5976509150505327,
"train_speed(iter/s)": 0.223915
},
{
"epoch": 1.4098613251155623,
"grad_norm": 1.075709342956543,
"learning_rate": 7.382316769215767e-05,
"loss": 1.8275850296020508,
"memory(GiB)": 118.24,
"step": 3660,
"token_acc": 0.5840770314701738,
"train_speed(iter/s)": 0.223818
},
{
"epoch": 1.4117873651771957,
"grad_norm": 1.401357650756836,
"learning_rate": 7.369263382914015e-05,
"loss": 1.8152078628540038,
"memory(GiB)": 118.24,
"step": 3665,
"token_acc": 0.5861759425493717,
"train_speed(iter/s)": 0.223983
},
{
"epoch": 1.413713405238829,
"grad_norm": 1.6760005950927734,
"learning_rate": 7.35620495065889e-05,
"loss": 1.8125579833984375,
"memory(GiB)": 118.24,
"step": 3670,
"token_acc": 0.5612711476909008,
"train_speed(iter/s)": 0.223672
},
{
"epoch": 1.4156394453004624,
"grad_norm": 1.07817804813385,
"learning_rate": 7.343141531321474e-05,
"loss": 1.8047115325927734,
"memory(GiB)": 118.24,
"step": 3675,
"token_acc": 0.5848544647261964,
"train_speed(iter/s)": 0.223836
},
{
"epoch": 1.4175654853620956,
"grad_norm": 1.3136463165283203,
"learning_rate": 7.330073183795321e-05,
"loss": 1.8179817199707031,
"memory(GiB)": 118.24,
"step": 3680,
"token_acc": 0.5842886675436948,
"train_speed(iter/s)": 0.223998
},
{
"epoch": 1.4194915254237288,
"grad_norm": 0.6776313185691833,
"learning_rate": 7.316999966996216e-05,
"loss": 1.8441036224365235,
"memory(GiB)": 118.24,
"step": 3685,
"token_acc": 0.5781990521327014,
"train_speed(iter/s)": 0.22379
},
{
"epoch": 1.421417565485362,
"grad_norm": 0.8565744757652283,
"learning_rate": 7.303921939861882e-05,
"loss": 1.8648609161376952,
"memory(GiB)": 118.24,
"step": 3690,
"token_acc": 0.5672235481304694,
"train_speed(iter/s)": 0.223955
},
{
"epoch": 1.4233436055469955,
"grad_norm": 0.7837241888046265,
"learning_rate": 7.290839161351737e-05,
"loss": 1.8636650085449218,
"memory(GiB)": 118.24,
"step": 3695,
"token_acc": 0.5752885624344176,
"train_speed(iter/s)": 0.223582
},
{
"epoch": 1.4252696456086287,
"grad_norm": 0.861605703830719,
"learning_rate": 7.277751690446615e-05,
"loss": 1.8081920623779297,
"memory(GiB)": 118.24,
"step": 3700,
"token_acc": 0.569410486280902,
"train_speed(iter/s)": 0.22375
},
{
"epoch": 1.427195685670262,
"grad_norm": 1.1699762344360352,
"learning_rate": 7.264659586148512e-05,
"loss": 1.7875905990600587,
"memory(GiB)": 118.24,
"step": 3705,
"token_acc": 0.5894225855901891,
"train_speed(iter/s)": 0.223914
},
{
"epoch": 1.4291217257318953,
"grad_norm": 0.8197382092475891,
"learning_rate": 7.251562907480304e-05,
"loss": 1.8165103912353515,
"memory(GiB)": 118.24,
"step": 3710,
"token_acc": 0.5899446494464945,
"train_speed(iter/s)": 0.223467
},
{
"epoch": 1.4310477657935285,
"grad_norm": 1.119502305984497,
"learning_rate": 7.238461713485491e-05,
"loss": 1.8033952713012695,
"memory(GiB)": 118.24,
"step": 3715,
"token_acc": 0.5838014981273408,
"train_speed(iter/s)": 0.223631
},
{
"epoch": 1.4329738058551618,
"grad_norm": 0.7231950759887695,
"learning_rate": 7.225356063227934e-05,
"loss": 1.8534526824951172,
"memory(GiB)": 118.24,
"step": 3720,
"token_acc": 0.5901639344262295,
"train_speed(iter/s)": 0.223631
},
{
"epoch": 1.434899845916795,
"grad_norm": 0.6805221438407898,
"learning_rate": 7.212246015791585e-05,
"loss": 1.823033332824707,
"memory(GiB)": 118.24,
"step": 3725,
"token_acc": 0.5860956292167792,
"train_speed(iter/s)": 0.223795
},
{
"epoch": 1.4368258859784284,
"grad_norm": 1.6532373428344727,
"learning_rate": 7.199131630280212e-05,
"loss": 1.8163490295410156,
"memory(GiB)": 118.24,
"step": 3730,
"token_acc": 0.57074395253309,
"train_speed(iter/s)": 0.223578
},
{
"epoch": 1.4387519260400616,
"grad_norm": 0.8490932583808899,
"learning_rate": 7.186012965817143e-05,
"loss": 1.863621139526367,
"memory(GiB)": 118.24,
"step": 3735,
"token_acc": 0.5782407407407407,
"train_speed(iter/s)": 0.223736
},
{
"epoch": 1.4406779661016949,
"grad_norm": 0.9240019917488098,
"learning_rate": 7.172890081545e-05,
"loss": 1.838235092163086,
"memory(GiB)": 118.24,
"step": 3740,
"token_acc": 0.5957372466806429,
"train_speed(iter/s)": 0.223894
},
{
"epoch": 1.4426040061633283,
"grad_norm": 0.7089791297912598,
"learning_rate": 7.159763036625428e-05,
"loss": 1.7420970916748046,
"memory(GiB)": 118.24,
"step": 3745,
"token_acc": 0.5895997960744328,
"train_speed(iter/s)": 0.223694
},
{
"epoch": 1.4445300462249615,
"grad_norm": 1.2524844408035278,
"learning_rate": 7.146631890238828e-05,
"loss": 1.8006404876708983,
"memory(GiB)": 118.24,
"step": 3750,
"token_acc": 0.5788431933142731,
"train_speed(iter/s)": 0.223857
},
{
"epoch": 1.4464560862865947,
"grad_norm": 0.9933207631111145,
"learning_rate": 7.133496701584096e-05,
"loss": 1.8426431655883788,
"memory(GiB)": 118.24,
"step": 3755,
"token_acc": 0.5983285453120919,
"train_speed(iter/s)": 0.223631
},
{
"epoch": 1.448382126348228,
"grad_norm": 1.5586143732070923,
"learning_rate": 7.120357529878341e-05,
"loss": 1.8038496017456054,
"memory(GiB)": 118.24,
"step": 3760,
"token_acc": 0.5678546141137597,
"train_speed(iter/s)": 0.223791
},
{
"epoch": 1.4503081664098614,
"grad_norm": 1.0300601720809937,
"learning_rate": 7.107214434356638e-05,
"loss": 1.7585687637329102,
"memory(GiB)": 118.24,
"step": 3765,
"token_acc": 0.5792090395480226,
"train_speed(iter/s)": 0.22395
},
{
"epoch": 1.4522342064714946,
"grad_norm": 1.08930242061615,
"learning_rate": 7.094067474271752e-05,
"loss": 1.8514856338500976,
"memory(GiB)": 118.24,
"step": 3770,
"token_acc": 0.590959697172122,
"train_speed(iter/s)": 0.223671
},
{
"epoch": 1.4541602465331278,
"grad_norm": 2.7024083137512207,
"learning_rate": 7.080916708893865e-05,
"loss": 1.8160589218139649,
"memory(GiB)": 118.24,
"step": 3775,
"token_acc": 0.5636192271442035,
"train_speed(iter/s)": 0.223835
},
{
"epoch": 1.4560862865947612,
"grad_norm": 1.2765828371047974,
"learning_rate": 7.06776219751032e-05,
"loss": 1.8457393646240234,
"memory(GiB)": 118.24,
"step": 3780,
"token_acc": 0.5682948891904116,
"train_speed(iter/s)": 0.223561
},
{
"epoch": 1.4580123266563945,
"grad_norm": 0.8677070736885071,
"learning_rate": 7.054603999425342e-05,
"loss": 1.7986244201660155,
"memory(GiB)": 118.24,
"step": 3785,
"token_acc": 0.5850661625708885,
"train_speed(iter/s)": 0.223722
},
{
"epoch": 1.4599383667180277,
"grad_norm": 0.8453196883201599,
"learning_rate": 7.04144217395978e-05,
"loss": 1.8284860610961915,
"memory(GiB)": 118.24,
"step": 3790,
"token_acc": 0.5859569648924122,
"train_speed(iter/s)": 0.223478
},
{
"epoch": 1.461864406779661,
"grad_norm": 1.015557885169983,
"learning_rate": 7.02827678045084e-05,
"loss": 1.8364437103271485,
"memory(GiB)": 118.24,
"step": 3795,
"token_acc": 0.5993773946360154,
"train_speed(iter/s)": 0.22363
},
{
"epoch": 1.4637904468412943,
"grad_norm": 1.7438759803771973,
"learning_rate": 7.015107878251805e-05,
"loss": 1.774271583557129,
"memory(GiB)": 118.24,
"step": 3800,
"token_acc": 0.5734016484740476,
"train_speed(iter/s)": 0.223791
},
{
"epoch": 1.4657164869029276,
"grad_norm": 0.8605408668518066,
"learning_rate": 7.001935526731784e-05,
"loss": 1.8239732742309571,
"memory(GiB)": 118.24,
"step": 3805,
"token_acc": 0.5945497630331753,
"train_speed(iter/s)": 0.223408
},
{
"epoch": 1.467642526964561,
"grad_norm": 2.304865598678589,
"learning_rate": 6.988759785275433e-05,
"loss": 1.7899288177490233,
"memory(GiB)": 118.24,
"step": 3810,
"token_acc": 0.6034602076124568,
"train_speed(iter/s)": 0.223563
},
{
"epoch": 1.4695685670261942,
"grad_norm": 1.3854377269744873,
"learning_rate": 6.97558071328269e-05,
"loss": 1.8322067260742188,
"memory(GiB)": 118.24,
"step": 3815,
"token_acc": 0.5869630519675578,
"train_speed(iter/s)": 0.223282
},
{
"epoch": 1.4714946070878274,
"grad_norm": 0.7945308685302734,
"learning_rate": 6.96239837016851e-05,
"loss": 1.825433349609375,
"memory(GiB)": 118.24,
"step": 3820,
"token_acc": 0.5654494981849242,
"train_speed(iter/s)": 0.22344
},
{
"epoch": 1.4734206471494606,
"grad_norm": 2.0651774406433105,
"learning_rate": 6.949212815362594e-05,
"loss": 1.850387954711914,
"memory(GiB)": 118.24,
"step": 3825,
"token_acc": 0.5795557570262919,
"train_speed(iter/s)": 0.223598
},
{
"epoch": 1.4753466872110939,
"grad_norm": 1.0030419826507568,
"learning_rate": 6.936024108309125e-05,
"loss": 1.7984760284423829,
"memory(GiB)": 118.24,
"step": 3830,
"token_acc": 0.5759725960362124,
"train_speed(iter/s)": 0.223502
},
{
"epoch": 1.4772727272727273,
"grad_norm": 0.8452328443527222,
"learning_rate": 6.922832308466492e-05,
"loss": 1.846176528930664,
"memory(GiB)": 118.24,
"step": 3835,
"token_acc": 0.572118286059143,
"train_speed(iter/s)": 0.223661
},
{
"epoch": 1.4791987673343605,
"grad_norm": 0.8833498358726501,
"learning_rate": 6.909637475307032e-05,
"loss": 1.8553993225097656,
"memory(GiB)": 118.24,
"step": 3840,
"token_acc": 0.5760393873085339,
"train_speed(iter/s)": 0.223519
},
{
"epoch": 1.481124807395994,
"grad_norm": 0.9554951786994934,
"learning_rate": 6.896439668316754e-05,
"loss": 1.822835922241211,
"memory(GiB)": 118.24,
"step": 3845,
"token_acc": 0.5748560460652591,
"train_speed(iter/s)": 0.223676
},
{
"epoch": 1.4830508474576272,
"grad_norm": 0.9319162368774414,
"learning_rate": 6.883238946995072e-05,
"loss": 1.7554649353027343,
"memory(GiB)": 118.24,
"step": 3850,
"token_acc": 0.6158998252766453,
"train_speed(iter/s)": 0.223486
},
{
"epoch": 1.4849768875192604,
"grad_norm": 0.7295608520507812,
"learning_rate": 6.870035370854549e-05,
"loss": 1.803689193725586,
"memory(GiB)": 118.24,
"step": 3855,
"token_acc": 0.5767782841291856,
"train_speed(iter/s)": 0.223639
},
{
"epoch": 1.4869029275808936,
"grad_norm": 0.6170604228973389,
"learning_rate": 6.856828999420606e-05,
"loss": 1.8226484298706054,
"memory(GiB)": 118.24,
"step": 3860,
"token_acc": 0.575970977379428,
"train_speed(iter/s)": 0.223797
},
{
"epoch": 1.488828967642527,
"grad_norm": 1.4971683025360107,
"learning_rate": 6.843619892231268e-05,
"loss": 1.8372892379760741,
"memory(GiB)": 118.24,
"step": 3865,
"token_acc": 0.5786862003780718,
"train_speed(iter/s)": 0.223536
},
{
"epoch": 1.4907550077041603,
"grad_norm": 0.8652157187461853,
"learning_rate": 6.830408108836903e-05,
"loss": 1.7618188858032227,
"memory(GiB)": 118.24,
"step": 3870,
"token_acc": 0.6116504854368932,
"train_speed(iter/s)": 0.223697
},
{
"epoch": 1.4926810477657935,
"grad_norm": 0.7496504783630371,
"learning_rate": 6.817193708799933e-05,
"loss": 1.8382587432861328,
"memory(GiB)": 118.24,
"step": 3875,
"token_acc": 0.564877259239277,
"train_speed(iter/s)": 0.223253
},
{
"epoch": 1.494607087827427,
"grad_norm": 0.9220601916313171,
"learning_rate": 6.803976751694582e-05,
"loss": 1.8546356201171874,
"memory(GiB)": 118.24,
"step": 3880,
"token_acc": 0.571156692746881,
"train_speed(iter/s)": 0.223408
},
{
"epoch": 1.4965331278890601,
"grad_norm": 0.7417863011360168,
"learning_rate": 6.790757297106602e-05,
"loss": 1.802634048461914,
"memory(GiB)": 118.24,
"step": 3885,
"token_acc": 0.5866625691456668,
"train_speed(iter/s)": 0.223567
},
{
"epoch": 1.4984591679506933,
"grad_norm": 0.9604321122169495,
"learning_rate": 6.777535404633001e-05,
"loss": 1.8321372985839843,
"memory(GiB)": 118.24,
"step": 3890,
"token_acc": 0.6075491209927611,
"train_speed(iter/s)": 0.223175
},
{
"epoch": 1.5003852080123266,
"grad_norm": 1.0275555849075317,
"learning_rate": 6.764311133881782e-05,
"loss": 1.800084686279297,
"memory(GiB)": 118.24,
"step": 3895,
"token_acc": 0.5742320819112628,
"train_speed(iter/s)": 0.223328
},
{
"epoch": 1.50231124807396,
"grad_norm": 0.9112734794616699,
"learning_rate": 6.751084544471669e-05,
"loss": 1.7598453521728517,
"memory(GiB)": 118.24,
"step": 3900,
"token_acc": 0.5997248968363136,
"train_speed(iter/s)": 0.223206
},
{
"epoch": 1.5042372881355932,
"grad_norm": 2.0053160190582275,
"learning_rate": 6.737855696031835e-05,
"loss": 1.8199298858642579,
"memory(GiB)": 118.24,
"step": 3905,
"token_acc": 0.5812690134724033,
"train_speed(iter/s)": 0.223297
},
{
"epoch": 1.5061633281972266,
"grad_norm": 2.413304328918457,
"learning_rate": 6.724624648201641e-05,
"loss": 1.7942798614501954,
"memory(GiB)": 118.24,
"step": 3910,
"token_acc": 0.5803246910588805,
"train_speed(iter/s)": 0.223143
},
{
"epoch": 1.5080893682588599,
"grad_norm": 1.2519792318344116,
"learning_rate": 6.711391460630366e-05,
"loss": 1.794654083251953,
"memory(GiB)": 118.24,
"step": 3915,
"token_acc": 0.590481038432171,
"train_speed(iter/s)": 0.223299
},
{
"epoch": 1.510015408320493,
"grad_norm": 0.7496642470359802,
"learning_rate": 6.698156192976932e-05,
"loss": 1.820594024658203,
"memory(GiB)": 118.24,
"step": 3920,
"token_acc": 0.5823251999179824,
"train_speed(iter/s)": 0.223425
},
{
"epoch": 1.5119414483821263,
"grad_norm": 0.6488379240036011,
"learning_rate": 6.684918904909636e-05,
"loss": 1.7711185455322265,
"memory(GiB)": 118.24,
"step": 3925,
"token_acc": 0.5854161298634373,
"train_speed(iter/s)": 0.223271
},
{
"epoch": 1.5138674884437595,
"grad_norm": 0.6287446618080139,
"learning_rate": 6.671679656105887e-05,
"loss": 1.8201759338378907,
"memory(GiB)": 118.24,
"step": 3930,
"token_acc": 0.5729193842942865,
"train_speed(iter/s)": 0.223398
},
{
"epoch": 1.515793528505393,
"grad_norm": 1.0703041553497314,
"learning_rate": 6.658438506251936e-05,
"loss": 1.795046615600586,
"memory(GiB)": 118.24,
"step": 3935,
"token_acc": 0.5691599539700806,
"train_speed(iter/s)": 0.223165
},
{
"epoch": 1.5177195685670262,
"grad_norm": 0.8465911149978638,
"learning_rate": 6.645195515042601e-05,
"loss": 1.7988338470458984,
"memory(GiB)": 118.24,
"step": 3940,
"token_acc": 0.5716981132075472,
"train_speed(iter/s)": 0.223318
},
{
"epoch": 1.5196456086286596,
"grad_norm": 0.9418315887451172,
"learning_rate": 6.631950742181e-05,
"loss": 1.8301557540893554,
"memory(GiB)": 118.24,
"step": 3945,
"token_acc": 0.5683256010122312,
"train_speed(iter/s)": 0.223469
},
{
"epoch": 1.5215716486902928,
"grad_norm": 0.7098641395568848,
"learning_rate": 6.618704247378288e-05,
"loss": 1.808327865600586,
"memory(GiB)": 118.24,
"step": 3950,
"token_acc": 0.5765514279579128,
"train_speed(iter/s)": 0.223226
},
{
"epoch": 1.523497688751926,
"grad_norm": 2.7469899654388428,
"learning_rate": 6.605456090353379e-05,
"loss": 1.8220361709594726,
"memory(GiB)": 118.24,
"step": 3955,
"token_acc": 0.5714612918002748,
"train_speed(iter/s)": 0.223336
},
{
"epoch": 1.5254237288135593,
"grad_norm": 0.906548798084259,
"learning_rate": 6.592206330832681e-05,
"loss": 1.7978946685791015,
"memory(GiB)": 118.24,
"step": 3960,
"token_acc": 0.5825361785626686,
"train_speed(iter/s)": 0.22302
},
{
"epoch": 1.5273497688751925,
"grad_norm": 0.6986387968063354,
"learning_rate": 6.578955028549828e-05,
"loss": 1.8580524444580078,
"memory(GiB)": 118.24,
"step": 3965,
"token_acc": 0.5950443786982249,
"train_speed(iter/s)": 0.223171
},
{
"epoch": 1.529275808936826,
"grad_norm": 0.9410300254821777,
"learning_rate": 6.56570224324541e-05,
"loss": 1.8048225402832032,
"memory(GiB)": 118.24,
"step": 3970,
"token_acc": 0.5865906623235614,
"train_speed(iter/s)": 0.222901
},
{
"epoch": 1.5312018489984591,
"grad_norm": 0.9247927665710449,
"learning_rate": 6.5524480346667e-05,
"loss": 1.828157615661621,
"memory(GiB)": 118.24,
"step": 3975,
"token_acc": 0.5807531380753138,
"train_speed(iter/s)": 0.223054
},
{
"epoch": 1.5331278890600926,
"grad_norm": 0.5807234048843384,
"learning_rate": 6.53919246256739e-05,
"loss": 1.7655223846435546,
"memory(GiB)": 118.24,
"step": 3980,
"token_acc": 0.5690470266235382,
"train_speed(iter/s)": 0.223204
},
{
"epoch": 1.5350539291217258,
"grad_norm": 0.7462795376777649,
"learning_rate": 6.525935586707319e-05,
"loss": 1.8265541076660157,
"memory(GiB)": 118.24,
"step": 3985,
"token_acc": 0.5957257346393589,
"train_speed(iter/s)": 0.222975
},
{
"epoch": 1.536979969183359,
"grad_norm": 0.9380358457565308,
"learning_rate": 6.5126774668522e-05,
"loss": 1.8238748550415038,
"memory(GiB)": 118.24,
"step": 3990,
"token_acc": 0.5750702529104778,
"train_speed(iter/s)": 0.223127
},
{
"epoch": 1.5389060092449922,
"grad_norm": 1.2271819114685059,
"learning_rate": 6.49941816277336e-05,
"loss": 1.8019058227539062,
"memory(GiB)": 118.24,
"step": 3995,
"token_acc": 0.5838189152846257,
"train_speed(iter/s)": 0.222916
},
{
"epoch": 1.5408320493066254,
"grad_norm": 1.2185630798339844,
"learning_rate": 6.486157734247461e-05,
"loss": 1.8059097290039063,
"memory(GiB)": 118.24,
"step": 4000,
"token_acc": 0.5705741626794258,
"train_speed(iter/s)": 0.223071
},
{
"epoch": 1.5427580893682589,
"grad_norm": 0.8724796772003174,
"learning_rate": 6.472896241056236e-05,
"loss": 1.7723880767822267,
"memory(GiB)": 118.24,
"step": 4005,
"token_acc": 0.6481288981288982,
"train_speed(iter/s)": 0.221989
},
{
"epoch": 1.5446841294298923,
"grad_norm": 0.9546380639076233,
"learning_rate": 6.459633742986217e-05,
"loss": 1.8220291137695312,
"memory(GiB)": 118.24,
"step": 4010,
"token_acc": 0.5860163382988948,
"train_speed(iter/s)": 0.222137
},
{
"epoch": 1.5466101694915255,
"grad_norm": 0.7918930053710938,
"learning_rate": 6.446370299828465e-05,
"loss": 1.821142578125,
"memory(GiB)": 118.24,
"step": 4015,
"token_acc": 0.5894054054054054,
"train_speed(iter/s)": 0.22229
},
{
"epoch": 1.5485362095531587,
"grad_norm": 0.8845969438552856,
"learning_rate": 6.433105971378306e-05,
"loss": 1.7757440567016602,
"memory(GiB)": 118.24,
"step": 4020,
"token_acc": 0.5863309352517986,
"train_speed(iter/s)": 0.222439
},
{
"epoch": 1.550462249614792,
"grad_norm": 0.8936904072761536,
"learning_rate": 6.41984081743505e-05,
"loss": 1.8229129791259766,
"memory(GiB)": 131.93,
"step": 4025,
"token_acc": 0.5717443729903537,
"train_speed(iter/s)": 0.222543
},
{
"epoch": 1.5523882896764252,
"grad_norm": 1.8596059083938599,
"learning_rate": 6.406574897801739e-05,
"loss": 1.8074674606323242,
"memory(GiB)": 131.93,
"step": 4030,
"token_acc": 0.5809238949817215,
"train_speed(iter/s)": 0.222289
},
{
"epoch": 1.5543143297380584,
"grad_norm": 1.0437047481536865,
"learning_rate": 6.393308272284855e-05,
"loss": 1.7794158935546875,
"memory(GiB)": 131.93,
"step": 4035,
"token_acc": 0.589622641509434,
"train_speed(iter/s)": 0.222438
},
{
"epoch": 1.5562403697996918,
"grad_norm": 1.4879014492034912,
"learning_rate": 6.38004100069407e-05,
"loss": 1.8027093887329102,
"memory(GiB)": 131.93,
"step": 4040,
"token_acc": 0.5775363993529004,
"train_speed(iter/s)": 0.222586
},
{
"epoch": 1.5581664098613253,
"grad_norm": 0.862655520439148,
"learning_rate": 6.36677314284197e-05,
"loss": 1.8362937927246095,
"memory(GiB)": 131.93,
"step": 4045,
"token_acc": 0.5806672760511883,
"train_speed(iter/s)": 0.222309
},
{
"epoch": 1.5600924499229585,
"grad_norm": 1.5662386417388916,
"learning_rate": 6.353504758543777e-05,
"loss": 1.7975168228149414,
"memory(GiB)": 131.93,
"step": 4050,
"token_acc": 0.5845424933372816,
"train_speed(iter/s)": 0.222458
},
{
"epoch": 1.5620184899845917,
"grad_norm": 1.3671258687973022,
"learning_rate": 6.340235907617091e-05,
"loss": 1.8101303100585937,
"memory(GiB)": 131.93,
"step": 4055,
"token_acc": 0.5825965565379246,
"train_speed(iter/s)": 0.222194
},
{
"epoch": 1.563944530046225,
"grad_norm": 1.1299470663070679,
"learning_rate": 6.326966649881613e-05,
"loss": 1.780502700805664,
"memory(GiB)": 131.93,
"step": 4060,
"token_acc": 0.5811097992916174,
"train_speed(iter/s)": 0.222347
},
{
"epoch": 1.5658705701078581,
"grad_norm": 1.2680153846740723,
"learning_rate": 6.313697045158885e-05,
"loss": 1.79473876953125,
"memory(GiB)": 131.93,
"step": 4065,
"token_acc": 0.5804911323328786,
"train_speed(iter/s)": 0.222494
},
{
"epoch": 1.5677966101694916,
"grad_norm": 0.9676305055618286,
"learning_rate": 6.300427153272006e-05,
"loss": 1.8003368377685547,
"memory(GiB)": 131.93,
"step": 4070,
"token_acc": 0.5807224106964678,
"train_speed(iter/s)": 0.222272
},
{
"epoch": 1.5697226502311248,
"grad_norm": 0.7961211800575256,
"learning_rate": 6.287157034045371e-05,
"loss": 1.8583356857299804,
"memory(GiB)": 131.93,
"step": 4075,
"token_acc": 0.5850395850395851,
"train_speed(iter/s)": 0.222421
},
{
"epoch": 1.5716486902927582,
"grad_norm": 0.9799847602844238,
"learning_rate": 6.2738867473044e-05,
"loss": 1.8402521133422851,
"memory(GiB)": 131.93,
"step": 4080,
"token_acc": 0.5914113510798593,
"train_speed(iter/s)": 0.2224
},
{
"epoch": 1.5735747303543914,
"grad_norm": 1.205005407333374,
"learning_rate": 6.26061635287527e-05,
"loss": 1.8169498443603516,
"memory(GiB)": 131.93,
"step": 4085,
"token_acc": 0.5942886544893233,
"train_speed(iter/s)": 0.22233
},
{
"epoch": 1.5755007704160247,
"grad_norm": 2.520035743713379,
"learning_rate": 6.247345910584645e-05,
"loss": 1.8226825714111328,
"memory(GiB)": 131.93,
"step": 4090,
"token_acc": 0.5723228995057661,
"train_speed(iter/s)": 0.222294
},
{
"epoch": 1.5774268104776579,
"grad_norm": 2.071319580078125,
"learning_rate": 6.234075480259397e-05,
"loss": 1.8224838256835938,
"memory(GiB)": 131.93,
"step": 4095,
"token_acc": 0.5953954866651471,
"train_speed(iter/s)": 0.222272
},
{
"epoch": 1.579352850539291,
"grad_norm": 1.01857590675354,
"learning_rate": 6.220805121726354e-05,
"loss": 1.8347482681274414,
"memory(GiB)": 131.93,
"step": 4100,
"token_acc": 0.5785667324128863,
"train_speed(iter/s)": 0.222422
},
{
"epoch": 1.5812788906009245,
"grad_norm": 1.273715615272522,
"learning_rate": 6.207534894812013e-05,
"loss": 1.7838895797729493,
"memory(GiB)": 131.93,
"step": 4105,
"token_acc": 0.5911742328176516,
"train_speed(iter/s)": 0.222437
},
{
"epoch": 1.5832049306625577,
"grad_norm": 0.6911029815673828,
"learning_rate": 6.19426485934228e-05,
"loss": 1.764463233947754,
"memory(GiB)": 131.93,
"step": 4110,
"token_acc": 0.5801031124689708,
"train_speed(iter/s)": 0.222381
},
{
"epoch": 1.5851309707241912,
"grad_norm": 1.2148245573043823,
"learning_rate": 6.180995075142201e-05,
"loss": 1.8277225494384766,
"memory(GiB)": 131.93,
"step": 4115,
"token_acc": 0.595609756097561,
"train_speed(iter/s)": 0.222423
},
{
"epoch": 1.5870570107858244,
"grad_norm": 0.6363925337791443,
"learning_rate": 6.167725602035681e-05,
"loss": 1.806521224975586,
"memory(GiB)": 131.93,
"step": 4120,
"token_acc": 0.5807007466973004,
"train_speed(iter/s)": 0.222437
},
{
"epoch": 1.5889830508474576,
"grad_norm": 0.7358555793762207,
"learning_rate": 6.154456499845234e-05,
"loss": 1.812693214416504,
"memory(GiB)": 131.93,
"step": 4125,
"token_acc": 0.5861892583120205,
"train_speed(iter/s)": 0.222584
},
{
"epoch": 1.5909090909090908,
"grad_norm": 0.742152214050293,
"learning_rate": 6.141187828391695e-05,
"loss": 1.7563091278076173,
"memory(GiB)": 131.93,
"step": 4130,
"token_acc": 0.5806530812668794,
"train_speed(iter/s)": 0.222364
},
{
"epoch": 1.592835130970724,
"grad_norm": 1.2658886909484863,
"learning_rate": 6.127919647493952e-05,
"loss": 1.7521839141845703,
"memory(GiB)": 131.93,
"step": 4135,
"token_acc": 0.612416964741952,
"train_speed(iter/s)": 0.22251
},
{
"epoch": 1.5947611710323575,
"grad_norm": 0.7957227230072021,
"learning_rate": 6.114652016968692e-05,
"loss": 1.7864873886108399,
"memory(GiB)": 131.93,
"step": 4140,
"token_acc": 0.5793151642208246,
"train_speed(iter/s)": 0.222519
},
{
"epoch": 1.596687211093991,
"grad_norm": 0.8658797740936279,
"learning_rate": 6.101384996630115e-05,
"loss": 1.7663434982299804,
"memory(GiB)": 131.93,
"step": 4145,
"token_acc": 0.5923976608187135,
"train_speed(iter/s)": 0.22245
},
{
"epoch": 1.5986132511556241,
"grad_norm": 0.9087325930595398,
"learning_rate": 6.088118646289672e-05,
"loss": 1.8283920288085938,
"memory(GiB)": 131.93,
"step": 4150,
"token_acc": 0.5819885476314419,
"train_speed(iter/s)": 0.222484
},
{
"epoch": 1.6005392912172574,
"grad_norm": 1.0251250267028809,
"learning_rate": 6.074853025755793e-05,
"loss": 1.785375213623047,
"memory(GiB)": 131.93,
"step": 4155,
"token_acc": 0.6091557962096973,
"train_speed(iter/s)": 0.222297
},
{
"epoch": 1.6024653312788906,
"grad_norm": 0.7247350811958313,
"learning_rate": 6.061588194833613e-05,
"loss": 1.7961769104003906,
"memory(GiB)": 131.93,
"step": 4160,
"token_acc": 0.6086206896551725,
"train_speed(iter/s)": 0.222444
},
{
"epoch": 1.6043913713405238,
"grad_norm": 0.8560896515846252,
"learning_rate": 6.0483242133247165e-05,
"loss": 1.7945735931396485,
"memory(GiB)": 131.93,
"step": 4165,
"token_acc": 0.5805125725338491,
"train_speed(iter/s)": 0.22226
},
{
"epoch": 1.606317411402157,
"grad_norm": 0.9486813545227051,
"learning_rate": 6.03506114102685e-05,
"loss": 1.7756511688232421,
"memory(GiB)": 131.93,
"step": 4170,
"token_acc": 0.6003756260434057,
"train_speed(iter/s)": 0.22235
},
{
"epoch": 1.6082434514637904,
"grad_norm": 0.7898660898208618,
"learning_rate": 6.0217990377336696e-05,
"loss": 1.8145938873291017,
"memory(GiB)": 131.93,
"step": 4175,
"token_acc": 0.5748299319727891,
"train_speed(iter/s)": 0.222495
},
{
"epoch": 1.6101694915254239,
"grad_norm": 0.9416387677192688,
"learning_rate": 6.0085379632344554e-05,
"loss": 1.788579559326172,
"memory(GiB)": 131.93,
"step": 4180,
"token_acc": 0.5826525708793849,
"train_speed(iter/s)": 0.222229
},
{
"epoch": 1.612095531587057,
"grad_norm": 1.1776823997497559,
"learning_rate": 5.9952779773138486e-05,
"loss": 1.748293685913086,
"memory(GiB)": 131.93,
"step": 4185,
"token_acc": 0.6081560283687943,
"train_speed(iter/s)": 0.222374
},
{
"epoch": 1.6140215716486903,
"grad_norm": 1.0704883337020874,
"learning_rate": 5.9820191397515905e-05,
"loss": 1.7967437744140624,
"memory(GiB)": 131.93,
"step": 4190,
"token_acc": 0.5724153810729911,
"train_speed(iter/s)": 0.222177
},
{
"epoch": 1.6159476117103235,
"grad_norm": 0.9205157160758972,
"learning_rate": 5.968761510322239e-05,
"loss": 1.7944927215576172,
"memory(GiB)": 131.93,
"step": 4195,
"token_acc": 0.5637065637065637,
"train_speed(iter/s)": 0.22232
},
{
"epoch": 1.6178736517719567,
"grad_norm": 0.9326324462890625,
"learning_rate": 5.9555051487949105e-05,
"loss": 1.7719268798828125,
"memory(GiB)": 131.93,
"step": 4200,
"token_acc": 0.5736491487786824,
"train_speed(iter/s)": 0.222462
},
{
"epoch": 1.6197996918335902,
"grad_norm": 2.1880314350128174,
"learning_rate": 5.9422501149329976e-05,
"loss": 1.7750030517578126,
"memory(GiB)": 131.93,
"step": 4205,
"token_acc": 0.5857284440039643,
"train_speed(iter/s)": 0.222237
},
{
"epoch": 1.6217257318952234,
"grad_norm": 3.239443063735962,
"learning_rate": 5.928996468493914e-05,
"loss": 1.7912681579589844,
"memory(GiB)": 131.93,
"step": 4210,
"token_acc": 0.5949332606919095,
"train_speed(iter/s)": 0.222378
},
{
"epoch": 1.6236517719568568,
"grad_norm": 1.9870812892913818,
"learning_rate": 5.9157442692288185e-05,
"loss": 1.80904541015625,
"memory(GiB)": 131.93,
"step": 4215,
"token_acc": 0.5568037303942348,
"train_speed(iter/s)": 0.222309
},
{
"epoch": 1.62557781201849,
"grad_norm": 0.6898970603942871,
"learning_rate": 5.902493576882339e-05,
"loss": 1.7626707077026367,
"memory(GiB)": 131.93,
"step": 4220,
"token_acc": 0.6142458100558659,
"train_speed(iter/s)": 0.222454
},
{
"epoch": 1.6275038520801233,
"grad_norm": 1.079793930053711,
"learning_rate": 5.8892444511923206e-05,
"loss": 1.814253807067871,
"memory(GiB)": 131.93,
"step": 4225,
"token_acc": 0.5744269538801436,
"train_speed(iter/s)": 0.222286
},
{
"epoch": 1.6294298921417565,
"grad_norm": 0.9346707463264465,
"learning_rate": 5.875996951889534e-05,
"loss": 1.783027458190918,
"memory(GiB)": 131.93,
"step": 4230,
"token_acc": 0.5825401142235518,
"train_speed(iter/s)": 0.222303
},
{
"epoch": 1.6313559322033897,
"grad_norm": 1.503077507019043,
"learning_rate": 5.8627511386974236e-05,
"loss": 1.7727964401245118,
"memory(GiB)": 131.93,
"step": 4235,
"token_acc": 0.5837714285714286,
"train_speed(iter/s)": 0.222321
},
{
"epoch": 1.6332819722650231,
"grad_norm": 0.903336226940155,
"learning_rate": 5.849507071331837e-05,
"loss": 1.820734977722168,
"memory(GiB)": 131.93,
"step": 4240,
"token_acc": 0.5954816709292413,
"train_speed(iter/s)": 0.222173
},
{
"epoch": 1.6352080123266564,
"grad_norm": 1.2855417728424072,
"learning_rate": 5.836264809500738e-05,
"loss": 1.8200553894042968,
"memory(GiB)": 131.93,
"step": 4245,
"token_acc": 0.5963172804532578,
"train_speed(iter/s)": 0.222317
},
{
"epoch": 1.6371340523882898,
"grad_norm": 0.736555278301239,
"learning_rate": 5.823024412903964e-05,
"loss": 1.8265460968017577,
"memory(GiB)": 131.93,
"step": 4250,
"token_acc": 0.5576419213973799,
"train_speed(iter/s)": 0.222026
},
{
"epoch": 1.639060092449923,
"grad_norm": 1.4227923154830933,
"learning_rate": 5.8097859412329384e-05,
"loss": 1.8268001556396485,
"memory(GiB)": 131.93,
"step": 4255,
"token_acc": 0.5727906976744186,
"train_speed(iter/s)": 0.222169
},
{
"epoch": 1.6409861325115562,
"grad_norm": 0.7862352132797241,
"learning_rate": 5.7965494541704e-05,
"loss": 1.8067546844482423,
"memory(GiB)": 131.93,
"step": 4260,
"token_acc": 0.5549690153775534,
"train_speed(iter/s)": 0.222065
},
{
"epoch": 1.6429121725731894,
"grad_norm": 0.9263100028038025,
"learning_rate": 5.783315011390153e-05,
"loss": 1.7670814514160156,
"memory(GiB)": 131.93,
"step": 4265,
"token_acc": 0.5933734939759037,
"train_speed(iter/s)": 0.222018
},
{
"epoch": 1.6448382126348227,
"grad_norm": 1.193380355834961,
"learning_rate": 5.770082672556773e-05,
"loss": 1.7904739379882812,
"memory(GiB)": 131.93,
"step": 4270,
"token_acc": 0.5779981965734896,
"train_speed(iter/s)": 0.22216
},
{
"epoch": 1.646764252696456,
"grad_norm": 0.9289668798446655,
"learning_rate": 5.7568524973253604e-05,
"loss": 1.8009286880493165,
"memory(GiB)": 131.93,
"step": 4275,
"token_acc": 0.5754556500607534,
"train_speed(iter/s)": 0.221855
},
{
"epoch": 1.6486902927580893,
"grad_norm": 0.7809291481971741,
"learning_rate": 5.743624545341257e-05,
"loss": 1.8702423095703125,
"memory(GiB)": 131.93,
"step": 4280,
"token_acc": 0.5695433598659405,
"train_speed(iter/s)": 0.221999
},
{
"epoch": 1.6506163328197228,
"grad_norm": 0.8659862279891968,
"learning_rate": 5.730398876239779e-05,
"loss": 1.7787857055664062,
"memory(GiB)": 131.93,
"step": 4285,
"token_acc": 0.6093607305936073,
"train_speed(iter/s)": 0.221986
},
{
"epoch": 1.652542372881356,
"grad_norm": 1.1571357250213623,
"learning_rate": 5.7171755496459547e-05,
"loss": 1.8045421600341798,
"memory(GiB)": 131.93,
"step": 4290,
"token_acc": 0.5736395406889665,
"train_speed(iter/s)": 0.221934
},
{
"epoch": 1.6544684129429892,
"grad_norm": 1.1856229305267334,
"learning_rate": 5.7039546251742516e-05,
"loss": 1.7755361557006837,
"memory(GiB)": 131.93,
"step": 4295,
"token_acc": 0.5821543105074515,
"train_speed(iter/s)": 0.222076
},
{
"epoch": 1.6563944530046224,
"grad_norm": 0.9358320236206055,
"learning_rate": 5.690736162428306e-05,
"loss": 1.813473892211914,
"memory(GiB)": 131.93,
"step": 4300,
"token_acc": 0.5949001683906664,
"train_speed(iter/s)": 0.22177
},
{
"epoch": 1.6583204930662556,
"grad_norm": 0.7613824009895325,
"learning_rate": 5.6775202210006576e-05,
"loss": 1.7764060974121094,
"memory(GiB)": 131.93,
"step": 4305,
"token_acc": 0.5889128869690424,
"train_speed(iter/s)": 0.221909
},
{
"epoch": 1.660246533127889,
"grad_norm": 0.9480492472648621,
"learning_rate": 5.6643068604724765e-05,
"loss": 1.8144424438476563,
"memory(GiB)": 131.93,
"step": 4310,
"token_acc": 0.5799785292538916,
"train_speed(iter/s)": 0.221692
},
{
"epoch": 1.6621725731895225,
"grad_norm": 1.0819952487945557,
"learning_rate": 5.651096140413301e-05,
"loss": 1.8126239776611328,
"memory(GiB)": 131.93,
"step": 4315,
"token_acc": 0.5771992818671454,
"train_speed(iter/s)": 0.221834
},
{
"epoch": 1.6640986132511557,
"grad_norm": 1.6762322187423706,
"learning_rate": 5.637888120380761e-05,
"loss": 1.798700714111328,
"memory(GiB)": 131.93,
"step": 4320,
"token_acc": 0.5753484320557491,
"train_speed(iter/s)": 0.221869
},
{
"epoch": 1.666024653312789,
"grad_norm": 0.7827457189559937,
"learning_rate": 5.6246828599203224e-05,
"loss": 1.7523693084716796,
"memory(GiB)": 131.93,
"step": 4325,
"token_acc": 0.6039861351819757,
"train_speed(iter/s)": 0.221795
},
{
"epoch": 1.6679506933744221,
"grad_norm": 1.329595923423767,
"learning_rate": 5.611480418565001e-05,
"loss": 1.779517364501953,
"memory(GiB)": 131.93,
"step": 4330,
"token_acc": 0.5670757511637748,
"train_speed(iter/s)": 0.221773
},
{
"epoch": 1.6698767334360554,
"grad_norm": 0.7551949620246887,
"learning_rate": 5.598280855835104e-05,
"loss": 1.7641143798828125,
"memory(GiB)": 131.93,
"step": 4335,
"token_acc": 0.603670441233893,
"train_speed(iter/s)": 0.221606
},
{
"epoch": 1.6718027734976888,
"grad_norm": 0.916948139667511,
"learning_rate": 5.585084231237967e-05,
"loss": 1.8208442687988282,
"memory(GiB)": 131.93,
"step": 4340,
"token_acc": 0.5839048925468678,
"train_speed(iter/s)": 0.221745
},
{
"epoch": 1.673728813559322,
"grad_norm": 0.811696469783783,
"learning_rate": 5.571890604267678e-05,
"loss": 1.7991548538208009,
"memory(GiB)": 131.93,
"step": 4345,
"token_acc": 0.5771144278606966,
"train_speed(iter/s)": 0.221768
},
{
"epoch": 1.6756548536209555,
"grad_norm": 0.9142571091651917,
"learning_rate": 5.5587000344048034e-05,
"loss": 1.792905044555664,
"memory(GiB)": 131.93,
"step": 4350,
"token_acc": 0.5745149029805962,
"train_speed(iter/s)": 0.221716
},
{
"epoch": 1.6775808936825887,
"grad_norm": 0.9663639068603516,
"learning_rate": 5.5455125811161385e-05,
"loss": 1.8136367797851562,
"memory(GiB)": 131.93,
"step": 4355,
"token_acc": 0.5760583941605839,
"train_speed(iter/s)": 0.221767
},
{
"epoch": 1.6795069337442219,
"grad_norm": 0.8619137406349182,
"learning_rate": 5.53232830385442e-05,
"loss": 1.7703617095947266,
"memory(GiB)": 131.93,
"step": 4360,
"token_acc": 0.5875139353400223,
"train_speed(iter/s)": 0.22158
},
{
"epoch": 1.681432973805855,
"grad_norm": 0.8836708068847656,
"learning_rate": 5.519147262058072e-05,
"loss": 1.757936668395996,
"memory(GiB)": 131.93,
"step": 4365,
"token_acc": 0.6040394551432597,
"train_speed(iter/s)": 0.22172
},
{
"epoch": 1.6833590138674883,
"grad_norm": 1.0510940551757812,
"learning_rate": 5.505969515150927e-05,
"loss": 1.7802169799804688,
"memory(GiB)": 131.93,
"step": 4370,
"token_acc": 0.6055925432756325,
"train_speed(iter/s)": 0.221399
},
{
"epoch": 1.6852850539291218,
"grad_norm": 0.8072844743728638,
"learning_rate": 5.492795122541963e-05,
"loss": 1.8022111892700194,
"memory(GiB)": 131.93,
"step": 4375,
"token_acc": 0.6045744446888058,
"train_speed(iter/s)": 0.221534
},
{
"epoch": 1.687211093990755,
"grad_norm": 1.3731038570404053,
"learning_rate": 5.479624143625043e-05,
"loss": 1.7882612228393555,
"memory(GiB)": 131.93,
"step": 4380,
"token_acc": 0.5847626645392899,
"train_speed(iter/s)": 0.221622
},
{
"epoch": 1.6891371340523884,
"grad_norm": 1.9726977348327637,
"learning_rate": 5.4664566377786315e-05,
"loss": 1.80009765625,
"memory(GiB)": 131.93,
"step": 4385,
"token_acc": 0.6001899335232669,
"train_speed(iter/s)": 0.221398
},
{
"epoch": 1.6910631741140216,
"grad_norm": 0.8724384307861328,
"learning_rate": 5.4532926643655436e-05,
"loss": 1.7494041442871093,
"memory(GiB)": 131.93,
"step": 4390,
"token_acc": 0.5881465517241379,
"train_speed(iter/s)": 0.221392
},
{
"epoch": 1.6929892141756548,
"grad_norm": 0.8237367868423462,
"learning_rate": 5.4401322827326615e-05,
"loss": 1.76648006439209,
"memory(GiB)": 131.93,
"step": 4395,
"token_acc": 0.5902809765085214,
"train_speed(iter/s)": 0.221276
},
{
"epoch": 1.694915254237288,
"grad_norm": 0.8389945030212402,
"learning_rate": 5.4269755522106776e-05,
"loss": 1.7597530364990235,
"memory(GiB)": 131.93,
"step": 4400,
"token_acc": 0.5829567462879277,
"train_speed(iter/s)": 0.221415
},
{
"epoch": 1.6968412942989213,
"grad_norm": 2.2436716556549072,
"learning_rate": 5.4138225321138296e-05,
"loss": 1.7983936309814452,
"memory(GiB)": 131.93,
"step": 4405,
"token_acc": 0.5844823556905819,
"train_speed(iter/s)": 0.221383
},
{
"epoch": 1.6987673343605547,
"grad_norm": 1.6652860641479492,
"learning_rate": 5.400673281739615e-05,
"loss": 1.7839183807373047,
"memory(GiB)": 131.93,
"step": 4410,
"token_acc": 0.6086360520904729,
"train_speed(iter/s)": 0.22131
},
{
"epoch": 1.700693374422188,
"grad_norm": 0.8282755017280579,
"learning_rate": 5.387527860368552e-05,
"loss": 1.791282844543457,
"memory(GiB)": 131.93,
"step": 4415,
"token_acc": 0.5967122117847993,
"train_speed(iter/s)": 0.221442
},
{
"epoch": 1.7026194144838214,
"grad_norm": 2.055833578109741,
"learning_rate": 5.374386327263882e-05,
"loss": 1.7740272521972655,
"memory(GiB)": 131.93,
"step": 4420,
"token_acc": 0.5839515814135103,
"train_speed(iter/s)": 0.221191
},
{
"epoch": 1.7045454545454546,
"grad_norm": 1.131196141242981,
"learning_rate": 5.3612487416713254e-05,
"loss": 1.794045639038086,
"memory(GiB)": 131.93,
"step": 4425,
"token_acc": 0.5852143300890453,
"train_speed(iter/s)": 0.221325
},
{
"epoch": 1.7064714946070878,
"grad_norm": 0.7844781279563904,
"learning_rate": 5.348115162818807e-05,
"loss": 1.7582126617431642,
"memory(GiB)": 131.93,
"step": 4430,
"token_acc": 0.5810031069684864,
"train_speed(iter/s)": 0.221206
},
{
"epoch": 1.708397534668721,
"grad_norm": 2.2037553787231445,
"learning_rate": 5.3349856499161796e-05,
"loss": 1.7799232482910157,
"memory(GiB)": 131.93,
"step": 4435,
"token_acc": 0.5913784202374807,
"train_speed(iter/s)": 0.22134
},
{
"epoch": 1.7103235747303542,
"grad_norm": 1.3611695766448975,
"learning_rate": 5.3218602621549766e-05,
"loss": 1.7474092483520507,
"memory(GiB)": 131.93,
"step": 4440,
"token_acc": 0.5956314757770933,
"train_speed(iter/s)": 0.221456
},
{
"epoch": 1.7122496147919877,
"grad_norm": 0.7552334666252136,
"learning_rate": 5.308739058708127e-05,
"loss": 1.862451171875,
"memory(GiB)": 131.93,
"step": 4445,
"token_acc": 0.5797303579730358,
"train_speed(iter/s)": 0.221259
},
{
"epoch": 1.7141756548536211,
"grad_norm": 0.9053819179534912,
"learning_rate": 5.295622098729695e-05,
"loss": 1.8101446151733398,
"memory(GiB)": 131.93,
"step": 4450,
"token_acc": 0.5588153115395362,
"train_speed(iter/s)": 0.221345
},
{
"epoch": 1.7161016949152543,
"grad_norm": 1.9687672853469849,
"learning_rate": 5.282509441354622e-05,
"loss": 1.7491125106811523,
"memory(GiB)": 131.93,
"step": 4455,
"token_acc": 0.5920114122681883,
"train_speed(iter/s)": 0.221101
},
{
"epoch": 1.7180277349768875,
"grad_norm": 1.2585374116897583,
"learning_rate": 5.269401145698439e-05,
"loss": 1.784451675415039,
"memory(GiB)": 131.93,
"step": 4460,
"token_acc": 0.6034816247582205,
"train_speed(iter/s)": 0.221236
},
{
"epoch": 1.7199537750385208,
"grad_norm": 0.7189536690711975,
"learning_rate": 5.256297270857026e-05,
"loss": 1.7744054794311523,
"memory(GiB)": 131.93,
"step": 4465,
"token_acc": 0.5843681519357194,
"train_speed(iter/s)": 0.221233
},
{
"epoch": 1.721879815100154,
"grad_norm": 0.9224844574928284,
"learning_rate": 5.2431978759063285e-05,
"loss": 1.8306072235107422,
"memory(GiB)": 131.93,
"step": 4470,
"token_acc": 0.575031525851198,
"train_speed(iter/s)": 0.221221
},
{
"epoch": 1.7238058551617874,
"grad_norm": 1.0133947134017944,
"learning_rate": 5.230103019902088e-05,
"loss": 1.8345813751220703,
"memory(GiB)": 131.93,
"step": 4475,
"token_acc": 0.5722408891186354,
"train_speed(iter/s)": 0.221244
},
{
"epoch": 1.7257318952234206,
"grad_norm": 0.7901082634925842,
"learning_rate": 5.217012761879598e-05,
"loss": 1.7997222900390626,
"memory(GiB)": 131.93,
"step": 4480,
"token_acc": 0.5869781312127237,
"train_speed(iter/s)": 0.22113
},
{
"epoch": 1.727657935285054,
"grad_norm": 2.8494746685028076,
"learning_rate": 5.2039271608534066e-05,
"loss": 1.8335643768310548,
"memory(GiB)": 131.93,
"step": 4485,
"token_acc": 0.5937803692905733,
"train_speed(iter/s)": 0.221266
},
{
"epoch": 1.7295839753466873,
"grad_norm": 0.9147348403930664,
"learning_rate": 5.1908462758170784e-05,
"loss": 1.7803791046142579,
"memory(GiB)": 131.93,
"step": 4490,
"token_acc": 0.6080928126768534,
"train_speed(iter/s)": 0.221085
},
{
"epoch": 1.7315100154083205,
"grad_norm": 2.125124931335449,
"learning_rate": 5.1777701657429155e-05,
"loss": 1.8200122833251953,
"memory(GiB)": 131.93,
"step": 4495,
"token_acc": 0.5815688646904618,
"train_speed(iter/s)": 0.221217
},
{
"epoch": 1.7334360554699537,
"grad_norm": 0.9141799211502075,
"learning_rate": 5.164698889581686e-05,
"loss": 1.796607208251953,
"memory(GiB)": 131.93,
"step": 4500,
"token_acc": 0.5673546985334058,
"train_speed(iter/s)": 0.221253
},
{
"epoch": 1.735362095531587,
"grad_norm": 1.0192279815673828,
"learning_rate": 5.1516325062623736e-05,
"loss": 1.7500907897949218,
"memory(GiB)": 131.93,
"step": 4505,
"token_acc": 0.588645071403692,
"train_speed(iter/s)": 0.221137
},
{
"epoch": 1.7372881355932204,
"grad_norm": 1.2992863655090332,
"learning_rate": 5.1385710746918985e-05,
"loss": 1.7655946731567382,
"memory(GiB)": 131.93,
"step": 4510,
"token_acc": 0.6145015105740181,
"train_speed(iter/s)": 0.221186
},
{
"epoch": 1.7392141756548536,
"grad_norm": 0.8210198283195496,
"learning_rate": 5.125514653754863e-05,
"loss": 1.79072265625,
"memory(GiB)": 131.93,
"step": 4515,
"token_acc": 0.5870560034865984,
"train_speed(iter/s)": 0.221149
},
{
"epoch": 1.741140215716487,
"grad_norm": 0.9174981117248535,
"learning_rate": 5.112463302313273e-05,
"loss": 1.7909740447998046,
"memory(GiB)": 131.93,
"step": 4520,
"token_acc": 0.5924792304328815,
"train_speed(iter/s)": 0.221281
},
{
"epoch": 1.7430662557781202,
"grad_norm": 0.9780272245407104,
"learning_rate": 5.099417079206281e-05,
"loss": 1.7749004364013672,
"memory(GiB)": 131.93,
"step": 4525,
"token_acc": 0.5970764617691154,
"train_speed(iter/s)": 0.221141
},
{
"epoch": 1.7449922958397535,
"grad_norm": 1.0628557205200195,
"learning_rate": 5.086376043249924e-05,
"loss": 1.757938766479492,
"memory(GiB)": 131.93,
"step": 4530,
"token_acc": 0.5930714808489875,
"train_speed(iter/s)": 0.221126
},
{
"epoch": 1.7469183359013867,
"grad_norm": 0.9142824411392212,
"learning_rate": 5.0733402532368485e-05,
"loss": 1.7809608459472657,
"memory(GiB)": 131.93,
"step": 4535,
"token_acc": 0.6041095890410959,
"train_speed(iter/s)": 0.221241
},
{
"epoch": 1.74884437596302,
"grad_norm": 2.513240098953247,
"learning_rate": 5.060309767936058e-05,
"loss": 1.8032955169677733,
"memory(GiB)": 131.93,
"step": 4540,
"token_acc": 0.5804898471844254,
"train_speed(iter/s)": 0.221034
},
{
"epoch": 1.7507704160246533,
"grad_norm": 1.0291776657104492,
"learning_rate": 5.047284646092633e-05,
"loss": 1.7572067260742188,
"memory(GiB)": 131.93,
"step": 4545,
"token_acc": 0.5715598437858948,
"train_speed(iter/s)": 0.221168
},
{
"epoch": 1.7526964560862865,
"grad_norm": 1.0176438093185425,
"learning_rate": 5.034264946427475e-05,
"loss": 1.7985729217529296,
"memory(GiB)": 131.93,
"step": 4550,
"token_acc": 0.5937277263007841,
"train_speed(iter/s)": 0.22088
},
{
"epoch": 1.75462249614792,
"grad_norm": 0.8897360563278198,
"learning_rate": 5.02125072763705e-05,
"loss": 1.8225889205932617,
"memory(GiB)": 136.87,
"step": 4555,
"token_acc": 0.5959084084084084,
"train_speed(iter/s)": 0.221008
},
{
"epoch": 1.7565485362095532,
"grad_norm": 1.406435489654541,
"learning_rate": 5.0082420483931005e-05,
"loss": 1.7655206680297852,
"memory(GiB)": 136.87,
"step": 4560,
"token_acc": 0.5744073121965153,
"train_speed(iter/s)": 0.221085
},
{
"epoch": 1.7584745762711864,
"grad_norm": 0.7303741574287415,
"learning_rate": 4.995238967342408e-05,
"loss": 1.8284893035888672,
"memory(GiB)": 136.87,
"step": 4565,
"token_acc": 0.5793450881612091,
"train_speed(iter/s)": 0.220843
},
{
"epoch": 1.7604006163328196,
"grad_norm": 0.9404786825180054,
"learning_rate": 4.982241543106507e-05,
"loss": 1.778439712524414,
"memory(GiB)": 136.87,
"step": 4570,
"token_acc": 0.5836909871244635,
"train_speed(iter/s)": 0.220918
},
{
"epoch": 1.7623266563944529,
"grad_norm": 1.1099157333374023,
"learning_rate": 4.969249834281432e-05,
"loss": 1.7675697326660156,
"memory(GiB)": 136.87,
"step": 4575,
"token_acc": 0.5851723282915944,
"train_speed(iter/s)": 0.220673
},
{
"epoch": 1.7642526964560863,
"grad_norm": 0.9159120321273804,
"learning_rate": 4.956263899437456e-05,
"loss": 1.7952730178833007,
"memory(GiB)": 136.87,
"step": 4580,
"token_acc": 0.5858278765201123,
"train_speed(iter/s)": 0.220802
},
{
"epoch": 1.7661787365177197,
"grad_norm": 1.147900104522705,
"learning_rate": 4.943283797118811e-05,
"loss": 1.8198644638061523,
"memory(GiB)": 136.87,
"step": 4585,
"token_acc": 0.5881942830583314,
"train_speed(iter/s)": 0.220899
},
{
"epoch": 1.768104776579353,
"grad_norm": 1.568490982055664,
"learning_rate": 4.9303095858434457e-05,
"loss": 1.7864479064941405,
"memory(GiB)": 136.87,
"step": 4590,
"token_acc": 0.573892674616695,
"train_speed(iter/s)": 0.220707
},
{
"epoch": 1.7700308166409862,
"grad_norm": 0.7823016047477722,
"learning_rate": 4.917341324102742e-05,
"loss": 1.817404556274414,
"memory(GiB)": 136.87,
"step": 4595,
"token_acc": 0.5949966193373901,
"train_speed(iter/s)": 0.220825
},
{
"epoch": 1.7719568567026194,
"grad_norm": 0.7892808318138123,
"learning_rate": 4.904379070361261e-05,
"loss": 1.7801900863647462,
"memory(GiB)": 136.87,
"step": 4600,
"token_acc": 0.5884646962233169,
"train_speed(iter/s)": 0.220509
},
{
"epoch": 1.7738828967642526,
"grad_norm": 0.9384677410125732,
"learning_rate": 4.891422883056484e-05,
"loss": 1.7853931427001952,
"memory(GiB)": 136.87,
"step": 4605,
"token_acc": 0.6032745591939547,
"train_speed(iter/s)": 0.220639
},
{
"epoch": 1.775808936825886,
"grad_norm": 1.1951448917388916,
"learning_rate": 4.878472820598534e-05,
"loss": 1.787259292602539,
"memory(GiB)": 136.87,
"step": 4610,
"token_acc": 0.6066497604959143,
"train_speed(iter/s)": 0.220293
},
{
"epoch": 1.7777349768875192,
"grad_norm": 0.680446982383728,
"learning_rate": 4.865528941369927e-05,
"loss": 1.7327657699584962,
"memory(GiB)": 136.87,
"step": 4615,
"token_acc": 0.5866331447726797,
"train_speed(iter/s)": 0.220421
},
{
"epoch": 1.7796610169491527,
"grad_norm": 0.9006595611572266,
"learning_rate": 4.852591303725306e-05,
"loss": 1.7611690521240235,
"memory(GiB)": 136.87,
"step": 4620,
"token_acc": 0.5814180929095355,
"train_speed(iter/s)": 0.220554
},
{
"epoch": 1.781587057010786,
"grad_norm": 3.494994640350342,
"learning_rate": 4.8396599659911654e-05,
"loss": 1.791965866088867,
"memory(GiB)": 136.87,
"step": 4625,
"token_acc": 0.5826539855072463,
"train_speed(iter/s)": 0.220356
},
{
"epoch": 1.7835130970724191,
"grad_norm": 0.6547976136207581,
"learning_rate": 4.8267349864656096e-05,
"loss": 1.8127758026123046,
"memory(GiB)": 136.87,
"step": 4630,
"token_acc": 0.5715144230769231,
"train_speed(iter/s)": 0.220486
},
{
"epoch": 1.7854391371340523,
"grad_norm": 0.7490419745445251,
"learning_rate": 4.8138164234180704e-05,
"loss": 1.729184341430664,
"memory(GiB)": 136.87,
"step": 4635,
"token_acc": 0.6081560283687943,
"train_speed(iter/s)": 0.220355
},
{
"epoch": 1.7873651771956856,
"grad_norm": 0.8735674023628235,
"learning_rate": 4.800904335089052e-05,
"loss": 1.7472841262817382,
"memory(GiB)": 136.87,
"step": 4640,
"token_acc": 0.6201038225578103,
"train_speed(iter/s)": 0.220487
},
{
"epoch": 1.789291217257319,
"grad_norm": 0.9173216223716736,
"learning_rate": 4.7879987796898775e-05,
"loss": 1.7994834899902343,
"memory(GiB)": 136.87,
"step": 4645,
"token_acc": 0.5629775696327336,
"train_speed(iter/s)": 0.220618
},
{
"epoch": 1.7912172573189522,
"grad_norm": 2.4372682571411133,
"learning_rate": 4.775099815402405e-05,
"loss": 1.761520004272461,
"memory(GiB)": 136.87,
"step": 4650,
"token_acc": 0.5876243093922652,
"train_speed(iter/s)": 0.220311
},
{
"epoch": 1.7931432973805856,
"grad_norm": 0.9179458022117615,
"learning_rate": 4.7622075003787895e-05,
"loss": 1.7844257354736328,
"memory(GiB)": 136.87,
"step": 4655,
"token_acc": 0.5902473250306963,
"train_speed(iter/s)": 0.22044
},
{
"epoch": 1.7950693374422189,
"grad_norm": 1.4642587900161743,
"learning_rate": 4.749321892741204e-05,
"loss": 1.7623058319091798,
"memory(GiB)": 136.87,
"step": 4660,
"token_acc": 0.5580135440180587,
"train_speed(iter/s)": 0.220267
},
{
"epoch": 1.796995377503852,
"grad_norm": 2.837496757507324,
"learning_rate": 4.736443050581579e-05,
"loss": 1.8073123931884765,
"memory(GiB)": 136.87,
"step": 4665,
"token_acc": 0.5952567109721136,
"train_speed(iter/s)": 0.220391
},
{
"epoch": 1.7989214175654853,
"grad_norm": 1.2552157640457153,
"learning_rate": 4.7235710319613544e-05,
"loss": 1.783104705810547,
"memory(GiB)": 136.87,
"step": 4670,
"token_acc": 0.5611565531672056,
"train_speed(iter/s)": 0.220176
},
{
"epoch": 1.8008474576271185,
"grad_norm": 1.5756300687789917,
"learning_rate": 4.7107058949111964e-05,
"loss": 1.794896125793457,
"memory(GiB)": 136.87,
"step": 4675,
"token_acc": 0.5817132442284325,
"train_speed(iter/s)": 0.220307
},
{
"epoch": 1.802773497688752,
"grad_norm": 0.7319515347480774,
"learning_rate": 4.6978476974307554e-05,
"loss": 1.821190643310547,
"memory(GiB)": 136.87,
"step": 4680,
"token_acc": 0.590921087358142,
"train_speed(iter/s)": 0.220438
},
{
"epoch": 1.8046995377503852,
"grad_norm": 1.2306523323059082,
"learning_rate": 4.6849964974883946e-05,
"loss": 1.7625011444091796,
"memory(GiB)": 136.87,
"step": 4685,
"token_acc": 0.5788793103448275,
"train_speed(iter/s)": 0.220291
},
{
"epoch": 1.8066255778120186,
"grad_norm": 1.4012212753295898,
"learning_rate": 4.672152353020924e-05,
"loss": 1.805426025390625,
"memory(GiB)": 136.87,
"step": 4690,
"token_acc": 0.5921122286924299,
"train_speed(iter/s)": 0.22039
},
{
"epoch": 1.8085516178736518,
"grad_norm": 1.441062331199646,
"learning_rate": 4.659315321933356e-05,
"loss": 1.8188335418701171,
"memory(GiB)": 136.87,
"step": 4695,
"token_acc": 0.5558343789209536,
"train_speed(iter/s)": 0.2202
},
{
"epoch": 1.810477657935285,
"grad_norm": 1.0652846097946167,
"learning_rate": 4.646485462098625e-05,
"loss": 1.7476085662841796,
"memory(GiB)": 136.87,
"step": 4700,
"token_acc": 0.5936967632027257,
"train_speed(iter/s)": 0.220326
},
{
"epoch": 1.8124036979969183,
"grad_norm": 1.1764566898345947,
"learning_rate": 4.633662831357342e-05,
"loss": 1.7230371475219726,
"memory(GiB)": 136.87,
"step": 4705,
"token_acc": 0.5962368908081431,
"train_speed(iter/s)": 0.220396
},
{
"epoch": 1.8143297380585515,
"grad_norm": 0.7621398568153381,
"learning_rate": 4.6208474875175236e-05,
"loss": 1.7616214752197266,
"memory(GiB)": 136.87,
"step": 4710,
"token_acc": 0.586130168737252,
"train_speed(iter/s)": 0.220282
},
{
"epoch": 1.816255778120185,
"grad_norm": 2.101602077484131,
"learning_rate": 4.60803948835433e-05,
"loss": 1.772210693359375,
"memory(GiB)": 136.87,
"step": 4715,
"token_acc": 0.5930422600980622,
"train_speed(iter/s)": 0.220335
},
{
"epoch": 1.8181818181818183,
"grad_norm": 1.008318305015564,
"learning_rate": 4.595238891609822e-05,
"loss": 1.7882339477539062,
"memory(GiB)": 136.87,
"step": 4720,
"token_acc": 0.586574074074074,
"train_speed(iter/s)": 0.220288
},
{
"epoch": 1.8201078582434516,
"grad_norm": 1.013633131980896,
"learning_rate": 4.582445754992678e-05,
"loss": 1.7856552124023437,
"memory(GiB)": 136.87,
"step": 4725,
"token_acc": 0.6065536205316223,
"train_speed(iter/s)": 0.220415
},
{
"epoch": 1.8220338983050848,
"grad_norm": 1.5142829418182373,
"learning_rate": 4.5696601361779496e-05,
"loss": 1.8153907775878906,
"memory(GiB)": 136.87,
"step": 4730,
"token_acc": 0.5887063655030801,
"train_speed(iter/s)": 0.220278
},
{
"epoch": 1.823959938366718,
"grad_norm": 0.6277472376823425,
"learning_rate": 4.556882092806791e-05,
"loss": 1.7784048080444337,
"memory(GiB)": 136.87,
"step": 4735,
"token_acc": 0.5881290904987587,
"train_speed(iter/s)": 0.220408
},
{
"epoch": 1.8258859784283512,
"grad_norm": 1.007671594619751,
"learning_rate": 4.5441116824862075e-05,
"loss": 1.803271484375,
"memory(GiB)": 136.87,
"step": 4740,
"token_acc": 0.5730870712401055,
"train_speed(iter/s)": 0.220295
},
{
"epoch": 1.8278120184899846,
"grad_norm": 2.1779470443725586,
"learning_rate": 4.531348962788794e-05,
"loss": 1.7714363098144532,
"memory(GiB)": 136.87,
"step": 4745,
"token_acc": 0.5853403141361256,
"train_speed(iter/s)": 0.220319
},
{
"epoch": 1.8297380585516179,
"grad_norm": 1.355035662651062,
"learning_rate": 4.518593991252469e-05,
"loss": 1.7307008743286132,
"memory(GiB)": 136.87,
"step": 4750,
"token_acc": 0.5931807566557683,
"train_speed(iter/s)": 0.220238
},
{
"epoch": 1.8316640986132513,
"grad_norm": 0.8230199813842773,
"learning_rate": 4.5058468253802264e-05,
"loss": 1.769505500793457,
"memory(GiB)": 136.87,
"step": 4755,
"token_acc": 0.584516129032258,
"train_speed(iter/s)": 0.220232
},
{
"epoch": 1.8335901386748845,
"grad_norm": 0.740838885307312,
"learning_rate": 4.4931075226398624e-05,
"loss": 1.7958070755004882,
"memory(GiB)": 136.87,
"step": 4760,
"token_acc": 0.6033260632497274,
"train_speed(iter/s)": 0.220358
},
{
"epoch": 1.8355161787365177,
"grad_norm": 0.7863432765007019,
"learning_rate": 4.4803761404637295e-05,
"loss": 1.771224021911621,
"memory(GiB)": 136.87,
"step": 4765,
"token_acc": 0.5859081721051111,
"train_speed(iter/s)": 0.220254
},
{
"epoch": 1.837442218798151,
"grad_norm": 0.7620553374290466,
"learning_rate": 4.467652736248473e-05,
"loss": 1.7881610870361329,
"memory(GiB)": 136.87,
"step": 4770,
"token_acc": 0.5714818266542404,
"train_speed(iter/s)": 0.22036
},
{
"epoch": 1.8393682588597842,
"grad_norm": 0.7606117129325867,
"learning_rate": 4.454937367354766e-05,
"loss": 1.745125961303711,
"memory(GiB)": 136.87,
"step": 4775,
"token_acc": 0.5948275862068966,
"train_speed(iter/s)": 0.220153
},
{
"epoch": 1.8412942989214176,
"grad_norm": 1.7403249740600586,
"learning_rate": 4.442230091107062e-05,
"loss": 1.8502304077148437,
"memory(GiB)": 136.87,
"step": 4780,
"token_acc": 0.5819545554820207,
"train_speed(iter/s)": 0.220277
},
{
"epoch": 1.8432203389830508,
"grad_norm": 0.8471406698226929,
"learning_rate": 4.429530964793325e-05,
"loss": 1.7093017578125,
"memory(GiB)": 136.87,
"step": 4785,
"token_acc": 0.6070791953144894,
"train_speed(iter/s)": 0.220402
},
{
"epoch": 1.8451463790446843,
"grad_norm": 0.8410062789916992,
"learning_rate": 4.4168400456647804e-05,
"loss": 1.765213966369629,
"memory(GiB)": 136.87,
"step": 4790,
"token_acc": 0.5746051537822111,
"train_speed(iter/s)": 0.220225
},
{
"epoch": 1.8470724191063175,
"grad_norm": 0.7389904260635376,
"learning_rate": 4.4041573909356535e-05,
"loss": 1.7936391830444336,
"memory(GiB)": 136.87,
"step": 4795,
"token_acc": 0.5778757346767422,
"train_speed(iter/s)": 0.220345
},
{
"epoch": 1.8489984591679507,
"grad_norm": 0.6481694579124451,
"learning_rate": 4.391483057782908e-05,
"loss": 1.7836284637451172,
"memory(GiB)": 136.87,
"step": 4800,
"token_acc": 0.5902085222121487,
"train_speed(iter/s)": 0.220186
},
{
"epoch": 1.850924499229584,
"grad_norm": 1.3757723569869995,
"learning_rate": 4.3788171033459966e-05,
"loss": 1.77281494140625,
"memory(GiB)": 136.87,
"step": 4805,
"token_acc": 0.6181568088033013,
"train_speed(iter/s)": 0.220312
},
{
"epoch": 1.8528505392912171,
"grad_norm": 0.9086828827857971,
"learning_rate": 4.366159584726595e-05,
"loss": 1.8004470825195313,
"memory(GiB)": 136.87,
"step": 4810,
"token_acc": 0.6059182714889619,
"train_speed(iter/s)": 0.220105
},
{
"epoch": 1.8547765793528506,
"grad_norm": 1.3315320014953613,
"learning_rate": 4.353510558988346e-05,
"loss": 1.7454950332641601,
"memory(GiB)": 136.87,
"step": 4815,
"token_acc": 0.6055421686746988,
"train_speed(iter/s)": 0.220231
},
{
"epoch": 1.8567026194144838,
"grad_norm": 0.9846578240394592,
"learning_rate": 4.34087008315661e-05,
"loss": 1.7798379898071288,
"memory(GiB)": 136.87,
"step": 4820,
"token_acc": 0.5910478128179044,
"train_speed(iter/s)": 0.220353
},
{
"epoch": 1.8586286594761172,
"grad_norm": 1.17121422290802,
"learning_rate": 4.328238214218196e-05,
"loss": 1.7810277938842773,
"memory(GiB)": 136.87,
"step": 4825,
"token_acc": 0.5834919124643198,
"train_speed(iter/s)": 0.220102
},
{
"epoch": 1.8605546995377504,
"grad_norm": 0.9881283044815063,
"learning_rate": 4.315615009121115e-05,
"loss": 1.7379592895507812,
"memory(GiB)": 136.87,
"step": 4830,
"token_acc": 0.5831913685406019,
"train_speed(iter/s)": 0.220228
},
{
"epoch": 1.8624807395993837,
"grad_norm": 1.1143995523452759,
"learning_rate": 4.30300052477432e-05,
"loss": 1.7863338470458985,
"memory(GiB)": 136.87,
"step": 4835,
"token_acc": 0.5957777777777777,
"train_speed(iter/s)": 0.220017
},
{
"epoch": 1.8644067796610169,
"grad_norm": 0.6762909889221191,
"learning_rate": 4.290394818047438e-05,
"loss": 1.7599510192871093,
"memory(GiB)": 136.87,
"step": 4840,
"token_acc": 0.5778923253150057,
"train_speed(iter/s)": 0.220143
},
{
"epoch": 1.86633281972265,
"grad_norm": 1.5299830436706543,
"learning_rate": 4.277797945770539e-05,
"loss": 1.75982608795166,
"memory(GiB)": 136.87,
"step": 4845,
"token_acc": 0.5765464533078577,
"train_speed(iter/s)": 0.220268
},
{
"epoch": 1.8682588597842835,
"grad_norm": 0.7435590624809265,
"learning_rate": 4.265209964733853e-05,
"loss": 1.85118408203125,
"memory(GiB)": 136.87,
"step": 4850,
"token_acc": 0.5891848264729621,
"train_speed(iter/s)": 0.219979
},
{
"epoch": 1.870184899845917,
"grad_norm": 1.0209436416625977,
"learning_rate": 4.2526309316875355e-05,
"loss": 1.786417579650879,
"memory(GiB)": 136.87,
"step": 4855,
"token_acc": 0.5877367896311066,
"train_speed(iter/s)": 0.220103
},
{
"epoch": 1.8721109399075502,
"grad_norm": 2.6529462337493896,
"learning_rate": 4.2400609033413945e-05,
"loss": 1.8036392211914063,
"memory(GiB)": 136.87,
"step": 4860,
"token_acc": 0.5727710843373494,
"train_speed(iter/s)": 0.219858
},
{
"epoch": 1.8740369799691834,
"grad_norm": 0.7397337555885315,
"learning_rate": 4.227499936364641e-05,
"loss": 1.7708890914916993,
"memory(GiB)": 136.87,
"step": 4865,
"token_acc": 0.6290562667460554,
"train_speed(iter/s)": 0.219983
},
{
"epoch": 1.8759630200308166,
"grad_norm": 0.8623694777488708,
"learning_rate": 4.214948087385643e-05,
"loss": 1.7600967407226562,
"memory(GiB)": 136.87,
"step": 4870,
"token_acc": 0.6226290251433613,
"train_speed(iter/s)": 0.219687
},
{
"epoch": 1.8778890600924498,
"grad_norm": 0.8745719790458679,
"learning_rate": 4.2024054129916555e-05,
"loss": 1.7324600219726562,
"memory(GiB)": 136.87,
"step": 4875,
"token_acc": 0.6134807793575566,
"train_speed(iter/s)": 0.219811
},
{
"epoch": 1.879815100154083,
"grad_norm": 0.9468375444412231,
"learning_rate": 4.189871969728576e-05,
"loss": 1.8063899993896484,
"memory(GiB)": 136.87,
"step": 4880,
"token_acc": 0.5982632541133455,
"train_speed(iter/s)": 0.219936
},
{
"epoch": 1.8817411402157165,
"grad_norm": 0.9925563335418701,
"learning_rate": 4.177347814100681e-05,
"loss": 1.7524160385131835,
"memory(GiB)": 136.87,
"step": 4885,
"token_acc": 0.6023249526899161,
"train_speed(iter/s)": 0.219596
},
{
"epoch": 1.88366718027735,
"grad_norm": 0.919121265411377,
"learning_rate": 4.164833002570377e-05,
"loss": 1.7760139465332032,
"memory(GiB)": 136.87,
"step": 4890,
"token_acc": 0.5709849157054127,
"train_speed(iter/s)": 0.219718
},
{
"epoch": 1.8855932203389831,
"grad_norm": 0.7400526404380798,
"learning_rate": 4.15232759155795e-05,
"loss": 1.808416748046875,
"memory(GiB)": 136.87,
"step": 4895,
"token_acc": 0.5926333150082463,
"train_speed(iter/s)": 0.219659
},
{
"epoch": 1.8875192604006163,
"grad_norm": 0.8366232514381409,
"learning_rate": 4.1398316374412995e-05,
"loss": 1.8037895202636718,
"memory(GiB)": 136.87,
"step": 4900,
"token_acc": 0.5835567470956211,
"train_speed(iter/s)": 0.219783
},
{
"epoch": 1.8894453004622496,
"grad_norm": 1.0510910749435425,
"learning_rate": 4.1273451965556895e-05,
"loss": 1.7811899185180664,
"memory(GiB)": 136.87,
"step": 4905,
"token_acc": 0.6086859189612716,
"train_speed(iter/s)": 0.219908
},
{
"epoch": 1.8913713405238828,
"grad_norm": 1.7145397663116455,
"learning_rate": 4.114868325193503e-05,
"loss": 1.7484718322753907,
"memory(GiB)": 136.87,
"step": 4910,
"token_acc": 0.5782068965517242,
"train_speed(iter/s)": 0.219745
},
{
"epoch": 1.8932973805855162,
"grad_norm": 2.069145917892456,
"learning_rate": 4.102401079603974e-05,
"loss": 1.8130809783935546,
"memory(GiB)": 136.87,
"step": 4915,
"token_acc": 0.6018835616438356,
"train_speed(iter/s)": 0.219866
},
{
"epoch": 1.8952234206471494,
"grad_norm": 1.0597784519195557,
"learning_rate": 4.089943515992948e-05,
"loss": 1.7761568069458007,
"memory(GiB)": 136.87,
"step": 4920,
"token_acc": 0.5935516628585935,
"train_speed(iter/s)": 0.21969
},
{
"epoch": 1.8971494607087829,
"grad_norm": 0.6227929592132568,
"learning_rate": 4.077495690522613e-05,
"loss": 1.7269193649291992,
"memory(GiB)": 136.87,
"step": 4925,
"token_acc": 0.5961311630101439,
"train_speed(iter/s)": 0.219815
},
{
"epoch": 1.899075500770416,
"grad_norm": 1.7546056509017944,
"learning_rate": 4.065057659311259e-05,
"loss": 1.7972156524658203,
"memory(GiB)": 136.87,
"step": 4930,
"token_acc": 0.5876288659793815,
"train_speed(iter/s)": 0.219503
},
{
"epoch": 1.9010015408320493,
"grad_norm": 0.6977673172950745,
"learning_rate": 4.052629478433024e-05,
"loss": 1.7847705841064454,
"memory(GiB)": 136.87,
"step": 4935,
"token_acc": 0.5927557513460597,
"train_speed(iter/s)": 0.219626
},
{
"epoch": 1.9029275808936825,
"grad_norm": 0.9524767994880676,
"learning_rate": 4.0402112039176294e-05,
"loss": 1.7926811218261718,
"memory(GiB)": 136.87,
"step": 4940,
"token_acc": 0.5765542839467986,
"train_speed(iter/s)": 0.219748
},
{
"epoch": 1.9048536209553157,
"grad_norm": 1.2936216592788696,
"learning_rate": 4.027802891750146e-05,
"loss": 1.7728578567504882,
"memory(GiB)": 136.87,
"step": 4945,
"token_acc": 0.5909990108803165,
"train_speed(iter/s)": 0.219572
},
{
"epoch": 1.9067796610169492,
"grad_norm": 0.7453409433364868,
"learning_rate": 4.015404597870723e-05,
"loss": 1.7843599319458008,
"memory(GiB)": 136.87,
"step": 4950,
"token_acc": 0.6277190801740211,
"train_speed(iter/s)": 0.219696
},
{
"epoch": 1.9087057010785824,
"grad_norm": 0.8125904202461243,
"learning_rate": 4.0030163781743486e-05,
"loss": 1.8140865325927735,
"memory(GiB)": 136.87,
"step": 4955,
"token_acc": 0.5720982142857143,
"train_speed(iter/s)": 0.219547
},
{
"epoch": 1.9106317411402158,
"grad_norm": 1.0446525812149048,
"learning_rate": 3.990638288510595e-05,
"loss": 1.7837417602539063,
"memory(GiB)": 136.87,
"step": 4960,
"token_acc": 0.5729465824238943,
"train_speed(iter/s)": 0.219669
},
{
"epoch": 1.912557781201849,
"grad_norm": 1.090869665145874,
"learning_rate": 3.978270384683359e-05,
"loss": 1.7389108657836914,
"memory(GiB)": 136.87,
"step": 4965,
"token_acc": 0.5873891153200671,
"train_speed(iter/s)": 0.219787
},
{
"epoch": 1.9144838212634823,
"grad_norm": 0.8425670266151428,
"learning_rate": 3.965912722450628e-05,
"loss": 1.7734956741333008,
"memory(GiB)": 136.87,
"step": 4970,
"token_acc": 0.6196412283368805,
"train_speed(iter/s)": 0.219583
},
{
"epoch": 1.9164098613251155,
"grad_norm": 0.9146763682365417,
"learning_rate": 3.9535653575242056e-05,
"loss": 1.7732589721679688,
"memory(GiB)": 136.87,
"step": 4975,
"token_acc": 0.5751953125,
"train_speed(iter/s)": 0.219701
},
{
"epoch": 1.9183359013867487,
"grad_norm": 2.2349743843078613,
"learning_rate": 3.941228345569476e-05,
"loss": 1.8016424179077148,
"memory(GiB)": 136.87,
"step": 4980,
"token_acc": 0.5855096882898062,
"train_speed(iter/s)": 0.219511
},
{
"epoch": 1.9202619414483821,
"grad_norm": 0.8929947018623352,
"learning_rate": 3.9289017422051556e-05,
"loss": 1.7526325225830077,
"memory(GiB)": 136.87,
"step": 4985,
"token_acc": 0.6034209692746278,
"train_speed(iter/s)": 0.219635
},
{
"epoch": 1.9221879815100154,
"grad_norm": 1.0452306270599365,
"learning_rate": 3.916585603003027e-05,
"loss": 1.7687679290771485,
"memory(GiB)": 136.87,
"step": 4990,
"token_acc": 0.6074582924435721,
"train_speed(iter/s)": 0.219537
},
{
"epoch": 1.9241140215716488,
"grad_norm": 0.8353390693664551,
"learning_rate": 3.9042799834877024e-05,
"loss": 1.7881763458251954,
"memory(GiB)": 136.87,
"step": 4995,
"token_acc": 0.5752255547427457,
"train_speed(iter/s)": 0.219654
},
{
"epoch": 1.926040061633282,
"grad_norm": 2.4853179454803467,
"learning_rate": 3.89198493913637e-05,
"loss": 1.7509956359863281,
"memory(GiB)": 136.87,
"step": 5000,
"token_acc": 0.6059449140987183,
"train_speed(iter/s)": 0.219774
},
{
"epoch": 1.9279661016949152,
"grad_norm": 1.1738383769989014,
"learning_rate": 3.879700525378534e-05,
"loss": 1.7904457092285155,
"memory(GiB)": 136.87,
"step": 5005,
"token_acc": 0.6083260041043682,
"train_speed(iter/s)": 0.21981
},
{
"epoch": 1.9298921417565484,
"grad_norm": 0.7832270860671997,
"learning_rate": 3.867426797595784e-05,
"loss": 1.816567611694336,
"memory(GiB)": 136.87,
"step": 5010,
"token_acc": 0.5781649245063879,
"train_speed(iter/s)": 0.219928
},
{
"epoch": 1.9318181818181817,
"grad_norm": 0.7609400153160095,
"learning_rate": 3.855163811121523e-05,
"loss": 1.77062931060791,
"memory(GiB)": 136.87,
"step": 5015,
"token_acc": 0.5856014047410009,
"train_speed(iter/s)": 0.219784
},
{
"epoch": 1.933744221879815,
"grad_norm": 0.8299560546875,
"learning_rate": 3.842911621240739e-05,
"loss": 1.6838603973388673,
"memory(GiB)": 136.87,
"step": 5020,
"token_acc": 0.6017058671491341,
"train_speed(iter/s)": 0.219906
},
{
"epoch": 1.9356702619414485,
"grad_norm": 0.7642867565155029,
"learning_rate": 3.830670283189741e-05,
"loss": 1.7932559967041015,
"memory(GiB)": 136.87,
"step": 5025,
"token_acc": 0.5891627803686431,
"train_speed(iter/s)": 0.220027
},
{
"epoch": 1.9375963020030817,
"grad_norm": 1.0746841430664062,
"learning_rate": 3.8184398521559136e-05,
"loss": 1.7707805633544922,
"memory(GiB)": 136.87,
"step": 5030,
"token_acc": 0.5746116107931316,
"train_speed(iter/s)": 0.219821
},
{
"epoch": 1.939522342064715,
"grad_norm": 0.9030567407608032,
"learning_rate": 3.806220383277474e-05,
"loss": 1.7698774337768555,
"memory(GiB)": 136.87,
"step": 5035,
"token_acc": 0.5837050950927448,
"train_speed(iter/s)": 0.219942
},
{
"epoch": 1.9414483821263482,
"grad_norm": 0.9361485242843628,
"learning_rate": 3.794011931643213e-05,
"loss": 1.8155391693115235,
"memory(GiB)": 136.87,
"step": 5040,
"token_acc": 0.5655793025871766,
"train_speed(iter/s)": 0.219775
},
{
"epoch": 1.9433744221879814,
"grad_norm": 0.6484358310699463,
"learning_rate": 3.7818145522922606e-05,
"loss": 1.7554157257080079,
"memory(GiB)": 136.87,
"step": 5045,
"token_acc": 0.602027207255268,
"train_speed(iter/s)": 0.219808
},
{
"epoch": 1.9453004622496148,
"grad_norm": 0.917418897151947,
"learning_rate": 3.769628300213823e-05,
"loss": 1.7940500259399415,
"memory(GiB)": 136.87,
"step": 5050,
"token_acc": 0.5830508474576271,
"train_speed(iter/s)": 0.219701
},
{
"epoch": 1.947226502311248,
"grad_norm": 0.8638196587562561,
"learning_rate": 3.757453230346941e-05,
"loss": 1.763375473022461,
"memory(GiB)": 136.87,
"step": 5055,
"token_acc": 0.6080776173285198,
"train_speed(iter/s)": 0.219692
},
{
"epoch": 1.9491525423728815,
"grad_norm": 0.9856778979301453,
"learning_rate": 3.74528939758025e-05,
"loss": 1.7669132232666016,
"memory(GiB)": 136.87,
"step": 5060,
"token_acc": 0.6098901098901099,
"train_speed(iter/s)": 0.219813
},
{
"epoch": 1.9510785824345147,
"grad_norm": 2.8649604320526123,
"learning_rate": 3.733136856751717e-05,
"loss": 1.7646055221557617,
"memory(GiB)": 136.87,
"step": 5065,
"token_acc": 0.5865094598299972,
"train_speed(iter/s)": 0.21978
},
{
"epoch": 1.953004622496148,
"grad_norm": 0.7658465504646301,
"learning_rate": 3.7209956626484105e-05,
"loss": 1.7879024505615235,
"memory(GiB)": 136.87,
"step": 5070,
"token_acc": 0.5792602377807133,
"train_speed(iter/s)": 0.21969
},
{
"epoch": 1.9549306625577811,
"grad_norm": 1.2134671211242676,
"learning_rate": 3.7088658700062365e-05,
"loss": 1.7850914001464844,
"memory(GiB)": 136.87,
"step": 5075,
"token_acc": 0.601921274601687,
"train_speed(iter/s)": 0.219808
},
{
"epoch": 1.9568567026194144,
"grad_norm": 0.6674994230270386,
"learning_rate": 3.6967475335097035e-05,
"loss": 1.6980182647705078,
"memory(GiB)": 136.87,
"step": 5080,
"token_acc": 0.6125792811839323,
"train_speed(iter/s)": 0.219741
},
{
"epoch": 1.9587827426810478,
"grad_norm": 0.7206431031227112,
"learning_rate": 3.684640707791676e-05,
"loss": 1.7626705169677734,
"memory(GiB)": 136.87,
"step": 5085,
"token_acc": 0.6083462934162779,
"train_speed(iter/s)": 0.219858
},
{
"epoch": 1.960708782742681,
"grad_norm": 0.767113447189331,
"learning_rate": 3.6725454474331166e-05,
"loss": 1.7204601287841796,
"memory(GiB)": 136.87,
"step": 5090,
"token_acc": 0.6090700344431688,
"train_speed(iter/s)": 0.219719
},
{
"epoch": 1.9626348228043144,
"grad_norm": 1.0114778280258179,
"learning_rate": 3.660461806962856e-05,
"loss": 1.7915451049804687,
"memory(GiB)": 136.87,
"step": 5095,
"token_acc": 0.5886148882230928,
"train_speed(iter/s)": 0.219836
},
{
"epoch": 1.9645608628659477,
"grad_norm": 1.0704529285430908,
"learning_rate": 3.648389840857334e-05,
"loss": 1.7517950057983398,
"memory(GiB)": 136.87,
"step": 5100,
"token_acc": 0.6034829202947086,
"train_speed(iter/s)": 0.21994
},
{
"epoch": 1.9664869029275809,
"grad_norm": 0.9311957955360413,
"learning_rate": 3.636329603540361e-05,
"loss": 1.7800918579101563,
"memory(GiB)": 136.87,
"step": 5105,
"token_acc": 0.5909961685823755,
"train_speed(iter/s)": 0.21991
},
{
"epoch": 1.968412942989214,
"grad_norm": 0.7079247832298279,
"learning_rate": 3.6242811493828734e-05,
"loss": 1.698584747314453,
"memory(GiB)": 136.87,
"step": 5110,
"token_acc": 0.5861823361823362,
"train_speed(iter/s)": 0.22003
},
{
"epoch": 1.9703389830508473,
"grad_norm": 0.7370250225067139,
"learning_rate": 3.6122445327026785e-05,
"loss": 1.7373451232910155,
"memory(GiB)": 136.87,
"step": 5115,
"token_acc": 0.5903924512116663,
"train_speed(iter/s)": 0.220016
},
{
"epoch": 1.9722650231124808,
"grad_norm": 0.8963513374328613,
"learning_rate": 3.6002198077642266e-05,
"loss": 1.8241622924804688,
"memory(GiB)": 136.87,
"step": 5120,
"token_acc": 0.5881872618399564,
"train_speed(iter/s)": 0.220134
},
{
"epoch": 1.974191063174114,
"grad_norm": 0.9271499514579773,
"learning_rate": 3.588207028778349e-05,
"loss": 1.7844337463378905,
"memory(GiB)": 136.87,
"step": 5125,
"token_acc": 0.6064779393011986,
"train_speed(iter/s)": 0.220154
},
{
"epoch": 1.9761171032357474,
"grad_norm": 0.8182199597358704,
"learning_rate": 3.5762062499020215e-05,
"loss": 1.7281490325927735,
"memory(GiB)": 136.87,
"step": 5130,
"token_acc": 0.5673478356405186,
"train_speed(iter/s)": 0.220273
},
{
"epoch": 1.9780431432973806,
"grad_norm": 1.1200106143951416,
"learning_rate": 3.564217525238124e-05,
"loss": 1.7470687866210937,
"memory(GiB)": 136.87,
"step": 5135,
"token_acc": 0.5805084745762712,
"train_speed(iter/s)": 0.220382
},
{
"epoch": 1.9799691833590138,
"grad_norm": 0.7583392858505249,
"learning_rate": 3.5522409088351915e-05,
"loss": 1.767685317993164,
"memory(GiB)": 136.87,
"step": 5140,
"token_acc": 0.6013662849105887,
"train_speed(iter/s)": 0.220441
},
{
"epoch": 1.981895223420647,
"grad_norm": 1.004130482673645,
"learning_rate": 3.5402764546871746e-05,
"loss": 1.7334518432617188,
"memory(GiB)": 136.87,
"step": 5145,
"token_acc": 0.5674142820314514,
"train_speed(iter/s)": 0.220562
},
{
"epoch": 1.9838212634822803,
"grad_norm": 0.855783998966217,
"learning_rate": 3.528324216733186e-05,
"loss": 1.7906742095947266,
"memory(GiB)": 136.87,
"step": 5150,
"token_acc": 0.5893255917820456,
"train_speed(iter/s)": 0.220681
},
{
"epoch": 1.9857473035439137,
"grad_norm": 1.9494175910949707,
"learning_rate": 3.5163842488572655e-05,
"loss": 1.7863471984863282,
"memory(GiB)": 136.87,
"step": 5155,
"token_acc": 0.5960616006059076,
"train_speed(iter/s)": 0.2208
},
{
"epoch": 1.9876733436055471,
"grad_norm": 0.6759247183799744,
"learning_rate": 3.504456604888144e-05,
"loss": 1.7436237335205078,
"memory(GiB)": 136.87,
"step": 5160,
"token_acc": 0.5814696485623003,
"train_speed(iter/s)": 0.220917
},
{
"epoch": 1.9895993836671804,
"grad_norm": 1.6342151165008545,
"learning_rate": 3.492541338598984e-05,
"loss": 1.7928539276123048,
"memory(GiB)": 136.87,
"step": 5165,
"token_acc": 0.5831344470962609,
"train_speed(iter/s)": 0.221036
},
{
"epoch": 1.9915254237288136,
"grad_norm": 1.6661423444747925,
"learning_rate": 3.4806385037071466e-05,
"loss": 1.758956527709961,
"memory(GiB)": 136.87,
"step": 5170,
"token_acc": 0.600776268367064,
"train_speed(iter/s)": 0.221155
},
{
"epoch": 1.9934514637904468,
"grad_norm": 0.8810990452766418,
"learning_rate": 3.468748153873955e-05,
"loss": 1.7792442321777344,
"memory(GiB)": 136.87,
"step": 5175,
"token_acc": 0.5803288145370638,
"train_speed(iter/s)": 0.221274
},
{
"epoch": 1.99537750385208,
"grad_norm": 2.638519287109375,
"learning_rate": 3.456870342704441e-05,
"loss": 1.7636144638061524,
"memory(GiB)": 136.87,
"step": 5180,
"token_acc": 0.59148570199957,
"train_speed(iter/s)": 0.221393
},
{
"epoch": 1.9973035439137135,
"grad_norm": 1.0382333993911743,
"learning_rate": 3.445005123747112e-05,
"loss": 1.7433509826660156,
"memory(GiB)": 136.87,
"step": 5185,
"token_acc": 0.5901734104046242,
"train_speed(iter/s)": 0.221509
},
{
"epoch": 1.9992295839753467,
"grad_norm": 0.6550606489181519,
"learning_rate": 3.4331525504937024e-05,
"loss": 1.756174659729004,
"memory(GiB)": 136.87,
"step": 5190,
"token_acc": 0.5928223305272485,
"train_speed(iter/s)": 0.221629
},
{
"epoch": 2.00115562403698,
"grad_norm": 1.002230167388916,
"learning_rate": 3.4213126763789365e-05,
"loss": 1.7513559341430665,
"memory(GiB)": 136.87,
"step": 5195,
"token_acc": 0.582216808769793,
"train_speed(iter/s)": 0.221279
},
{
"epoch": 2.0030816640986133,
"grad_norm": 0.8959957361221313,
"learning_rate": 3.4094855547802914e-05,
"loss": 1.7084320068359375,
"memory(GiB)": 136.87,
"step": 5200,
"token_acc": 0.6136532278011377,
"train_speed(iter/s)": 0.221395
},
{
"epoch": 2.0050077041602465,
"grad_norm": 1.1862905025482178,
"learning_rate": 3.397671239017747e-05,
"loss": 1.7631097793579102,
"memory(GiB)": 136.87,
"step": 5205,
"token_acc": 0.6013179571663921,
"train_speed(iter/s)": 0.221285
},
{
"epoch": 2.0069337442218798,
"grad_norm": 1.0142595767974854,
"learning_rate": 3.385869782353558e-05,
"loss": 1.7849939346313477,
"memory(GiB)": 136.87,
"step": 5210,
"token_acc": 0.5872841874486161,
"train_speed(iter/s)": 0.221314
},
{
"epoch": 2.008859784283513,
"grad_norm": 1.3959475755691528,
"learning_rate": 3.3740812379919966e-05,
"loss": 1.7400804519653321,
"memory(GiB)": 136.87,
"step": 5215,
"token_acc": 0.600238379022646,
"train_speed(iter/s)": 0.221429
},
{
"epoch": 2.010785824345146,
"grad_norm": 0.7532147169113159,
"learning_rate": 3.3623056590791304e-05,
"loss": 1.7917526245117188,
"memory(GiB)": 136.87,
"step": 5220,
"token_acc": 0.5999014535599901,
"train_speed(iter/s)": 0.221458
},
{
"epoch": 2.01271186440678,
"grad_norm": 0.6776307225227356,
"learning_rate": 3.350543098702578e-05,
"loss": 1.7292966842651367,
"memory(GiB)": 136.87,
"step": 5225,
"token_acc": 0.6041510377594399,
"train_speed(iter/s)": 0.221574
},
{
"epoch": 2.014637904468413,
"grad_norm": 1.0134159326553345,
"learning_rate": 3.338793609891254e-05,
"loss": 1.7872634887695313,
"memory(GiB)": 136.87,
"step": 5230,
"token_acc": 0.5996098512557912,
"train_speed(iter/s)": 0.22158
},
{
"epoch": 2.0165639445300463,
"grad_norm": 0.7890477180480957,
"learning_rate": 3.327057245615157e-05,
"loss": 1.7631288528442384,
"memory(GiB)": 136.87,
"step": 5235,
"token_acc": 0.6106666666666667,
"train_speed(iter/s)": 0.221691
},
{
"epoch": 2.0184899845916795,
"grad_norm": 0.9302046895027161,
"learning_rate": 3.3153340587851093e-05,
"loss": 1.7238309860229493,
"memory(GiB)": 136.87,
"step": 5240,
"token_acc": 0.5765494912118408,
"train_speed(iter/s)": 0.221808
},
{
"epoch": 2.0204160246533127,
"grad_norm": 0.9802621006965637,
"learning_rate": 3.303624102252521e-05,
"loss": 1.7790721893310546,
"memory(GiB)": 136.87,
"step": 5245,
"token_acc": 0.5934065934065934,
"train_speed(iter/s)": 0.221778
},
{
"epoch": 2.022342064714946,
"grad_norm": 0.8716186285018921,
"learning_rate": 3.291927428809168e-05,
"loss": 1.7698394775390625,
"memory(GiB)": 136.87,
"step": 5250,
"token_acc": 0.5776566757493188,
"train_speed(iter/s)": 0.221893
},
{
"epoch": 2.024268104776579,
"grad_norm": 0.5871915221214294,
"learning_rate": 3.28024409118693e-05,
"loss": 1.7210758209228516,
"memory(GiB)": 136.87,
"step": 5255,
"token_acc": 0.6186046511627907,
"train_speed(iter/s)": 0.221883
},
{
"epoch": 2.026194144838213,
"grad_norm": 0.6136463284492493,
"learning_rate": 3.268574142057575e-05,
"loss": 1.7313335418701172,
"memory(GiB)": 136.87,
"step": 5260,
"token_acc": 0.5952955367913149,
"train_speed(iter/s)": 0.221898
},
{
"epoch": 2.028120184899846,
"grad_norm": 0.7708998918533325,
"learning_rate": 3.256917634032509e-05,
"loss": 1.6860092163085938,
"memory(GiB)": 136.87,
"step": 5265,
"token_acc": 0.6016907011437096,
"train_speed(iter/s)": 0.221937
},
{
"epoch": 2.0300462249614792,
"grad_norm": 0.7130012512207031,
"learning_rate": 3.245274619662537e-05,
"loss": 1.722970962524414,
"memory(GiB)": 136.87,
"step": 5270,
"token_acc": 0.6030889924000981,
"train_speed(iter/s)": 0.222028
},
{
"epoch": 2.0319722650231125,
"grad_norm": 0.7865249514579773,
"learning_rate": 3.233645151437641e-05,
"loss": 1.7922784805297851,
"memory(GiB)": 136.87,
"step": 5275,
"token_acc": 0.591041162227603,
"train_speed(iter/s)": 0.221958
},
{
"epoch": 2.0338983050847457,
"grad_norm": 0.7858544588088989,
"learning_rate": 3.2220292817867176e-05,
"loss": 1.7304275512695313,
"memory(GiB)": 136.87,
"step": 5280,
"token_acc": 0.5880316518298714,
"train_speed(iter/s)": 0.222075
},
{
"epoch": 2.035824345146379,
"grad_norm": 0.7417407035827637,
"learning_rate": 3.210427063077374e-05,
"loss": 1.8049266815185547,
"memory(GiB)": 136.87,
"step": 5285,
"token_acc": 0.5957199348685741,
"train_speed(iter/s)": 0.222086
},
{
"epoch": 2.037750385208012,
"grad_norm": 0.7264186143875122,
"learning_rate": 3.198838547615666e-05,
"loss": 1.7907276153564453,
"memory(GiB)": 136.87,
"step": 5290,
"token_acc": 0.5973019517795637,
"train_speed(iter/s)": 0.221955
},
{
"epoch": 2.0396764252696458,
"grad_norm": 0.7485206127166748,
"learning_rate": 3.187263787645868e-05,
"loss": 1.7790372848510743,
"memory(GiB)": 136.87,
"step": 5295,
"token_acc": 0.5778218694885362,
"train_speed(iter/s)": 0.222067
},
{
"epoch": 2.041602465331279,
"grad_norm": 0.9737213253974915,
"learning_rate": 3.175702835350248e-05,
"loss": 1.7832809448242188,
"memory(GiB)": 136.87,
"step": 5300,
"token_acc": 0.5799609946367625,
"train_speed(iter/s)": 0.222181
},
{
"epoch": 2.043528505392912,
"grad_norm": 3.211221218109131,
"learning_rate": 3.1641557428488246e-05,
"loss": 1.7909473419189452,
"memory(GiB)": 136.87,
"step": 5305,
"token_acc": 0.6048717948717949,
"train_speed(iter/s)": 0.222259
},
{
"epoch": 2.0454545454545454,
"grad_norm": 0.6070092916488647,
"learning_rate": 3.152622562199133e-05,
"loss": 1.7160694122314453,
"memory(GiB)": 136.87,
"step": 5310,
"token_acc": 0.6003143006809848,
"train_speed(iter/s)": 0.222373
},
{
"epoch": 2.0473805855161786,
"grad_norm": 0.7154187560081482,
"learning_rate": 3.141103345395982e-05,
"loss": 1.7437379837036133,
"memory(GiB)": 136.87,
"step": 5315,
"token_acc": 0.5967302452316077,
"train_speed(iter/s)": 0.222372
},
{
"epoch": 2.049306625577812,
"grad_norm": 1.1265685558319092,
"learning_rate": 3.1295981443712336e-05,
"loss": 1.724435806274414,
"memory(GiB)": 136.87,
"step": 5320,
"token_acc": 0.5940999726850588,
"train_speed(iter/s)": 0.222375
},
{
"epoch": 2.0512326656394455,
"grad_norm": 0.6729488968849182,
"learning_rate": 3.1181070109935664e-05,
"loss": 1.7445075988769532,
"memory(GiB)": 136.87,
"step": 5325,
"token_acc": 0.6106037544393709,
"train_speed(iter/s)": 0.222491
},
{
"epoch": 2.0531587057010787,
"grad_norm": 1.0702611207962036,
"learning_rate": 3.106629997068228e-05,
"loss": 1.7624216079711914,
"memory(GiB)": 136.87,
"step": 5330,
"token_acc": 0.5906773488710853,
"train_speed(iter/s)": 0.222477
},
{
"epoch": 2.055084745762712,
"grad_norm": 0.7213516235351562,
"learning_rate": 3.095167154336824e-05,
"loss": 1.7853103637695313,
"memory(GiB)": 136.87,
"step": 5335,
"token_acc": 0.606768558951965,
"train_speed(iter/s)": 0.222488
},
{
"epoch": 2.057010785824345,
"grad_norm": 1.4011636972427368,
"learning_rate": 3.083718534477059e-05,
"loss": 1.812076950073242,
"memory(GiB)": 136.87,
"step": 5340,
"token_acc": 0.5760108425570364,
"train_speed(iter/s)": 0.222451
},
{
"epoch": 2.0589368258859784,
"grad_norm": 1.0200453996658325,
"learning_rate": 3.072284189102529e-05,
"loss": 1.7605985641479491,
"memory(GiB)": 136.87,
"step": 5345,
"token_acc": 0.6078136739293765,
"train_speed(iter/s)": 0.222566
},
{
"epoch": 2.0608628659476116,
"grad_norm": 0.6703549027442932,
"learning_rate": 3.060864169762466e-05,
"loss": 1.7926494598388671,
"memory(GiB)": 136.87,
"step": 5350,
"token_acc": 0.5757756563245824,
"train_speed(iter/s)": 0.222553
},
{
"epoch": 2.062788906009245,
"grad_norm": 0.8992184400558472,
"learning_rate": 3.0494585279415248e-05,
"loss": 1.8008771896362306,
"memory(GiB)": 136.87,
"step": 5355,
"token_acc": 0.5827029752899647,
"train_speed(iter/s)": 0.222652
},
{
"epoch": 2.0647149460708785,
"grad_norm": 2.7358310222625732,
"learning_rate": 3.0380673150595402e-05,
"loss": 1.7705488204956055,
"memory(GiB)": 136.87,
"step": 5360,
"token_acc": 0.5932246561385635,
"train_speed(iter/s)": 0.22273
},
{
"epoch": 2.0666409861325117,
"grad_norm": 0.8945984244346619,
"learning_rate": 3.026690582471294e-05,
"loss": 1.7663822174072266,
"memory(GiB)": 136.87,
"step": 5365,
"token_acc": 0.5744282744282744,
"train_speed(iter/s)": 0.222693
},
{
"epoch": 2.068567026194145,
"grad_norm": 0.8307556509971619,
"learning_rate": 3.015328381466287e-05,
"loss": 1.752301025390625,
"memory(GiB)": 136.87,
"step": 5370,
"token_acc": 0.5937697326878552,
"train_speed(iter/s)": 0.222792
},
{
"epoch": 2.070493066255778,
"grad_norm": 1.1805006265640259,
"learning_rate": 3.003980763268513e-05,
"loss": 1.752029037475586,
"memory(GiB)": 136.87,
"step": 5375,
"token_acc": 0.5853242320819113,
"train_speed(iter/s)": 0.222904
},
{
"epoch": 2.0724191063174113,
"grad_norm": 1.1215310096740723,
"learning_rate": 2.9926477790362143e-05,
"loss": 1.7429954528808593,
"memory(GiB)": 136.87,
"step": 5380,
"token_acc": 0.5878453038674033,
"train_speed(iter/s)": 0.222945
},
{
"epoch": 2.0743451463790445,
"grad_norm": 1.3918564319610596,
"learning_rate": 2.9813294798616685e-05,
"loss": 1.7547735214233398,
"memory(GiB)": 136.87,
"step": 5385,
"token_acc": 0.6170278637770897,
"train_speed(iter/s)": 0.223056
},
{
"epoch": 2.0762711864406778,
"grad_norm": 1.5303163528442383,
"learning_rate": 2.9700259167709395e-05,
"loss": 1.7574665069580078,
"memory(GiB)": 136.87,
"step": 5390,
"token_acc": 0.6038481813389562,
"train_speed(iter/s)": 0.223089
},
{
"epoch": 2.0781972265023114,
"grad_norm": 1.5610618591308594,
"learning_rate": 2.9587371407236627e-05,
"loss": 1.7871456146240234,
"memory(GiB)": 136.87,
"step": 5395,
"token_acc": 0.5936451549240181,
"train_speed(iter/s)": 0.223128
},
{
"epoch": 2.0801232665639446,
"grad_norm": 0.7098233699798584,
"learning_rate": 2.9474632026128115e-05,
"loss": 1.7829280853271485,
"memory(GiB)": 136.87,
"step": 5400,
"token_acc": 0.5740441572428648,
"train_speed(iter/s)": 0.22324
},
{
"epoch": 2.082049306625578,
"grad_norm": 0.7072461247444153,
"learning_rate": 2.9362041532644566e-05,
"loss": 1.765349769592285,
"memory(GiB)": 136.87,
"step": 5405,
"token_acc": 0.6166306695464363,
"train_speed(iter/s)": 0.223149
},
{
"epoch": 2.083975346687211,
"grad_norm": 1.2645729780197144,
"learning_rate": 2.9249600434375557e-05,
"loss": 1.7672847747802733,
"memory(GiB)": 136.87,
"step": 5410,
"token_acc": 0.5771569745343975,
"train_speed(iter/s)": 0.223261
},
{
"epoch": 2.0859013867488443,
"grad_norm": 0.6643367409706116,
"learning_rate": 2.9137309238237098e-05,
"loss": 1.7804122924804688,
"memory(GiB)": 136.87,
"step": 5415,
"token_acc": 0.5878535002318034,
"train_speed(iter/s)": 0.223192
},
{
"epoch": 2.0878274268104775,
"grad_norm": 1.6858524084091187,
"learning_rate": 2.9025168450469374e-05,
"loss": 1.791745948791504,
"memory(GiB)": 136.87,
"step": 5420,
"token_acc": 0.5888480392156863,
"train_speed(iter/s)": 0.2233
},
{
"epoch": 2.0897534668721107,
"grad_norm": 0.8708013892173767,
"learning_rate": 2.8913178576634565e-05,
"loss": 1.7970867156982422,
"memory(GiB)": 136.87,
"step": 5425,
"token_acc": 0.5805369127516778,
"train_speed(iter/s)": 0.223348
},
{
"epoch": 2.0916795069337444,
"grad_norm": 2.335855484008789,
"learning_rate": 2.880134012161441e-05,
"loss": 1.7321935653686524,
"memory(GiB)": 136.87,
"step": 5430,
"token_acc": 0.5963735717834079,
"train_speed(iter/s)": 0.223461
},
{
"epoch": 2.0936055469953776,
"grad_norm": 1.251335859298706,
"learning_rate": 2.8689653589608053e-05,
"loss": 1.7464317321777343,
"memory(GiB)": 136.87,
"step": 5435,
"token_acc": 0.6101456082667919,
"train_speed(iter/s)": 0.223572
},
{
"epoch": 2.095531587057011,
"grad_norm": 2.3458919525146484,
"learning_rate": 2.8578119484129743e-05,
"loss": 1.7120725631713867,
"memory(GiB)": 136.87,
"step": 5440,
"token_acc": 0.6019539078156313,
"train_speed(iter/s)": 0.223608
},
{
"epoch": 2.097457627118644,
"grad_norm": 0.7641324996948242,
"learning_rate": 2.8466738308006486e-05,
"loss": 1.747948455810547,
"memory(GiB)": 136.87,
"step": 5445,
"token_acc": 0.5750273822562979,
"train_speed(iter/s)": 0.223562
},
{
"epoch": 2.0993836671802772,
"grad_norm": 4.340232849121094,
"learning_rate": 2.8355510563375908e-05,
"loss": 1.742392349243164,
"memory(GiB)": 136.87,
"step": 5450,
"token_acc": 0.5916827852998066,
"train_speed(iter/s)": 0.22357
},
{
"epoch": 2.1013097072419105,
"grad_norm": 1.0343068838119507,
"learning_rate": 2.8244436751683873e-05,
"loss": 1.7836574554443358,
"memory(GiB)": 136.87,
"step": 5455,
"token_acc": 0.5978904039104708,
"train_speed(iter/s)": 0.223582
},
{
"epoch": 2.103235747303544,
"grad_norm": 0.9237492084503174,
"learning_rate": 2.8133517373682263e-05,
"loss": 1.7888507843017578,
"memory(GiB)": 136.87,
"step": 5460,
"token_acc": 0.5938592111832252,
"train_speed(iter/s)": 0.223695
},
{
"epoch": 2.1051617873651773,
"grad_norm": 1.36170494556427,
"learning_rate": 2.8022752929426804e-05,
"loss": 1.6904106140136719,
"memory(GiB)": 136.87,
"step": 5465,
"token_acc": 0.5820635611667392,
"train_speed(iter/s)": 0.223778
},
{
"epoch": 2.1070878274268106,
"grad_norm": 0.816930890083313,
"learning_rate": 2.7912143918274646e-05,
"loss": 1.7456085205078125,
"memory(GiB)": 136.87,
"step": 5470,
"token_acc": 0.6003277920861625,
"train_speed(iter/s)": 0.223616
},
{
"epoch": 2.1090138674884438,
"grad_norm": 1.202661156654358,
"learning_rate": 2.780169083888226e-05,
"loss": 1.7445419311523438,
"memory(GiB)": 136.87,
"step": 5475,
"token_acc": 0.5898176967541129,
"train_speed(iter/s)": 0.223726
},
{
"epoch": 2.110939907550077,
"grad_norm": 1.0403882265090942,
"learning_rate": 2.769139418920314e-05,
"loss": 1.7659944534301757,
"memory(GiB)": 136.87,
"step": 5480,
"token_acc": 0.5869369369369369,
"train_speed(iter/s)": 0.223676
},
{
"epoch": 2.11286594761171,
"grad_norm": 0.8089464902877808,
"learning_rate": 2.7581254466485497e-05,
"loss": 1.7627185821533202,
"memory(GiB)": 136.87,
"step": 5485,
"token_acc": 0.5913550782285866,
"train_speed(iter/s)": 0.223788
},
{
"epoch": 2.1147919876733434,
"grad_norm": 0.9885238409042358,
"learning_rate": 2.747127216727014e-05,
"loss": 1.7506807327270508,
"memory(GiB)": 136.87,
"step": 5490,
"token_acc": 0.5654557916381083,
"train_speed(iter/s)": 0.223726
},
{
"epoch": 2.116718027734977,
"grad_norm": 0.871893048286438,
"learning_rate": 2.736144778738809e-05,
"loss": 1.7617019653320312,
"memory(GiB)": 136.87,
"step": 5495,
"token_acc": 0.5988602576808721,
"train_speed(iter/s)": 0.223835
},
{
"epoch": 2.1186440677966103,
"grad_norm": 0.7188717126846313,
"learning_rate": 2.7251781821958512e-05,
"loss": 1.7487606048583983,
"memory(GiB)": 136.87,
"step": 5500,
"token_acc": 0.5977782920620227,
"train_speed(iter/s)": 0.223948
},
{
"epoch": 2.1205701078582435,
"grad_norm": 0.8923308849334717,
"learning_rate": 2.7142274765386318e-05,
"loss": 1.7874326705932617,
"memory(GiB)": 136.87,
"step": 5505,
"token_acc": 0.57819782496116,
"train_speed(iter/s)": 0.223963
},
{
"epoch": 2.1224961479198767,
"grad_norm": 0.6797767877578735,
"learning_rate": 2.7032927111360032e-05,
"loss": 1.7409374237060546,
"memory(GiB)": 136.87,
"step": 5510,
"token_acc": 0.6103928393833914,
"train_speed(iter/s)": 0.224071
},
{
"epoch": 2.12442218798151,
"grad_norm": 0.9791479110717773,
"learning_rate": 2.6923739352849573e-05,
"loss": 1.7571197509765626,
"memory(GiB)": 136.87,
"step": 5515,
"token_acc": 0.6049951969260327,
"train_speed(iter/s)": 0.224114
},
{
"epoch": 2.126348228043143,
"grad_norm": 0.9937036037445068,
"learning_rate": 2.6814711982103995e-05,
"loss": 1.7820331573486328,
"memory(GiB)": 136.87,
"step": 5520,
"token_acc": 0.5969299331517702,
"train_speed(iter/s)": 0.224225
},
{
"epoch": 2.1282742681047764,
"grad_norm": 0.8245801329612732,
"learning_rate": 2.670584549064929e-05,
"loss": 1.696131134033203,
"memory(GiB)": 136.87,
"step": 5525,
"token_acc": 0.5842323651452282,
"train_speed(iter/s)": 0.224336
},
{
"epoch": 2.13020030816641,
"grad_norm": 0.7906369566917419,
"learning_rate": 2.659714036928614e-05,
"loss": 1.6972728729248048,
"memory(GiB)": 136.87,
"step": 5530,
"token_acc": 0.6151954757806737,
"train_speed(iter/s)": 0.224182
},
{
"epoch": 2.1321263482280433,
"grad_norm": 0.9253937602043152,
"learning_rate": 2.6488597108087707e-05,
"loss": 1.7359500885009767,
"memory(GiB)": 136.87,
"step": 5535,
"token_acc": 0.595333667837431,
"train_speed(iter/s)": 0.224268
},
{
"epoch": 2.1340523882896765,
"grad_norm": 0.828896701335907,
"learning_rate": 2.6380216196397507e-05,
"loss": 1.7639318466186524,
"memory(GiB)": 136.87,
"step": 5540,
"token_acc": 0.6035739478015518,
"train_speed(iter/s)": 0.224233
},
{
"epoch": 2.1359784283513097,
"grad_norm": 0.6512668132781982,
"learning_rate": 2.627199812282705e-05,
"loss": 1.7584911346435548,
"memory(GiB)": 136.87,
"step": 5545,
"token_acc": 0.5846567310041534,
"train_speed(iter/s)": 0.224339
},
{
"epoch": 2.137904468412943,
"grad_norm": 0.7185530066490173,
"learning_rate": 2.616394337525383e-05,
"loss": 1.7568840026855468,
"memory(GiB)": 136.87,
"step": 5550,
"token_acc": 0.5904852976332775,
"train_speed(iter/s)": 0.224218
},
{
"epoch": 2.139830508474576,
"grad_norm": 1.4348018169403076,
"learning_rate": 2.6056052440818912e-05,
"loss": 1.789164924621582,
"memory(GiB)": 136.87,
"step": 5555,
"token_acc": 0.5907818220977816,
"train_speed(iter/s)": 0.224329
},
{
"epoch": 2.1417565485362093,
"grad_norm": 1.0587968826293945,
"learning_rate": 2.5948325805924933e-05,
"loss": 1.7193296432495118,
"memory(GiB)": 136.87,
"step": 5560,
"token_acc": 0.5816825315153075,
"train_speed(iter/s)": 0.224441
},
{
"epoch": 2.143682588597843,
"grad_norm": 1.2495542764663696,
"learning_rate": 2.5840763956233797e-05,
"loss": 1.7446285247802735,
"memory(GiB)": 136.87,
"step": 5565,
"token_acc": 0.5625936229402954,
"train_speed(iter/s)": 0.224302
},
{
"epoch": 2.145608628659476,
"grad_norm": 0.679328203201294,
"learning_rate": 2.5733367376664472e-05,
"loss": 1.7491580963134765,
"memory(GiB)": 136.87,
"step": 5570,
"token_acc": 0.5935931149892422,
"train_speed(iter/s)": 0.224412
},
{
"epoch": 2.1475346687211094,
"grad_norm": 0.9046332836151123,
"learning_rate": 2.5626136551390914e-05,
"loss": 1.7191360473632813,
"memory(GiB)": 136.87,
"step": 5575,
"token_acc": 0.5783503172466833,
"train_speed(iter/s)": 0.224369
},
{
"epoch": 2.1494607087827426,
"grad_norm": 0.9884324073791504,
"learning_rate": 2.5519071963839734e-05,
"loss": 1.7653175354003907,
"memory(GiB)": 136.87,
"step": 5580,
"token_acc": 0.5966894377299001,
"train_speed(iter/s)": 0.224476
},
{
"epoch": 2.151386748844376,
"grad_norm": 0.8270488381385803,
"learning_rate": 2.5412174096688126e-05,
"loss": 1.7322196960449219,
"memory(GiB)": 136.87,
"step": 5585,
"token_acc": 0.5961224013081056,
"train_speed(iter/s)": 0.224587
},
{
"epoch": 2.153312788906009,
"grad_norm": 1.0333666801452637,
"learning_rate": 2.5305443431861704e-05,
"loss": 1.764253807067871,
"memory(GiB)": 136.87,
"step": 5590,
"token_acc": 0.5771205586362703,
"train_speed(iter/s)": 0.224548
},
{
"epoch": 2.1552388289676427,
"grad_norm": 1.0959030389785767,
"learning_rate": 2.519888045053221e-05,
"loss": 1.757779312133789,
"memory(GiB)": 136.87,
"step": 5595,
"token_acc": 0.6020434896515588,
"train_speed(iter/s)": 0.224654
},
{
"epoch": 2.157164869029276,
"grad_norm": 0.7591630220413208,
"learning_rate": 2.5092485633115488e-05,
"loss": 1.686333465576172,
"memory(GiB)": 136.87,
"step": 5600,
"token_acc": 0.6006639791320845,
"train_speed(iter/s)": 0.22453
},
{
"epoch": 2.159090909090909,
"grad_norm": 2.6796927452087402,
"learning_rate": 2.498625945926924e-05,
"loss": 1.6895587921142579,
"memory(GiB)": 136.87,
"step": 5605,
"token_acc": 0.6046040981533013,
"train_speed(iter/s)": 0.224641
},
{
"epoch": 2.1610169491525424,
"grad_norm": 0.7851228713989258,
"learning_rate": 2.488020240789082e-05,
"loss": 1.6927921295166015,
"memory(GiB)": 136.87,
"step": 5610,
"token_acc": 0.6114089641861462,
"train_speed(iter/s)": 0.224616
},
{
"epoch": 2.1629429892141756,
"grad_norm": 1.051344394683838,
"learning_rate": 2.4774314957115232e-05,
"loss": 1.7543220520019531,
"memory(GiB)": 136.87,
"step": 5615,
"token_acc": 0.595572117492328,
"train_speed(iter/s)": 0.224725
},
{
"epoch": 2.164869029275809,
"grad_norm": 1.2848819494247437,
"learning_rate": 2.466859758431275e-05,
"loss": 1.7809551239013672,
"memory(GiB)": 136.87,
"step": 5620,
"token_acc": 0.5739819004524886,
"train_speed(iter/s)": 0.224793
},
{
"epoch": 2.166795069337442,
"grad_norm": 0.8399608731269836,
"learning_rate": 2.456305076608701e-05,
"loss": 1.7612316131591796,
"memory(GiB)": 136.87,
"step": 5625,
"token_acc": 0.5628223159868729,
"train_speed(iter/s)": 0.224754
},
{
"epoch": 2.1687211093990757,
"grad_norm": 0.9708801507949829,
"learning_rate": 2.4457674978272656e-05,
"loss": 1.7776823043823242,
"memory(GiB)": 136.87,
"step": 5630,
"token_acc": 0.5833490655087785,
"train_speed(iter/s)": 0.224784
},
{
"epoch": 2.170647149460709,
"grad_norm": 1.3746745586395264,
"learning_rate": 2.4352470695933276e-05,
"loss": 1.711482620239258,
"memory(GiB)": 136.87,
"step": 5635,
"token_acc": 0.5966542750929368,
"train_speed(iter/s)": 0.2247
},
{
"epoch": 2.172573189522342,
"grad_norm": 1.3227323293685913,
"learning_rate": 2.4247438393359327e-05,
"loss": 1.7514347076416015,
"memory(GiB)": 136.87,
"step": 5640,
"token_acc": 0.6215532506956741,
"train_speed(iter/s)": 0.224808
},
{
"epoch": 2.1744992295839753,
"grad_norm": 1.1723637580871582,
"learning_rate": 2.414257854406591e-05,
"loss": 1.7996936798095704,
"memory(GiB)": 136.87,
"step": 5645,
"token_acc": 0.589143659335517,
"train_speed(iter/s)": 0.224915
},
{
"epoch": 2.1764252696456086,
"grad_norm": 1.1936994791030884,
"learning_rate": 2.4037891620790614e-05,
"loss": 1.8253034591674804,
"memory(GiB)": 136.87,
"step": 5650,
"token_acc": 0.5688430698739977,
"train_speed(iter/s)": 0.224691
},
{
"epoch": 2.178351309707242,
"grad_norm": 0.8679848313331604,
"learning_rate": 2.3933378095491496e-05,
"loss": 1.747736358642578,
"memory(GiB)": 136.87,
"step": 5655,
"token_acc": 0.6099570200573066,
"train_speed(iter/s)": 0.224798
},
{
"epoch": 2.180277349768875,
"grad_norm": 0.7936636805534363,
"learning_rate": 2.3829038439344815e-05,
"loss": 1.7538631439208985,
"memory(GiB)": 136.87,
"step": 5660,
"token_acc": 0.6114092064388591,
"train_speed(iter/s)": 0.224568
},
{
"epoch": 2.1822033898305087,
"grad_norm": 1.0102686882019043,
"learning_rate": 2.3724873122743053e-05,
"loss": 1.757767105102539,
"memory(GiB)": 136.87,
"step": 5665,
"token_acc": 0.6019279841224837,
"train_speed(iter/s)": 0.224673
},
{
"epoch": 2.184129429892142,
"grad_norm": 1.174321174621582,
"learning_rate": 2.3620882615292648e-05,
"loss": 1.7683483123779298,
"memory(GiB)": 136.87,
"step": 5670,
"token_acc": 0.592433361994841,
"train_speed(iter/s)": 0.224683
},
{
"epoch": 2.186055469953775,
"grad_norm": 1.0656726360321045,
"learning_rate": 2.3517067385812017e-05,
"loss": 1.7764266967773437,
"memory(GiB)": 136.87,
"step": 5675,
"token_acc": 0.5856156757960366,
"train_speed(iter/s)": 0.22479
},
{
"epoch": 2.1879815100154083,
"grad_norm": 0.7482308149337769,
"learning_rate": 2.3413427902329337e-05,
"loss": 1.7619640350341796,
"memory(GiB)": 136.87,
"step": 5680,
"token_acc": 0.5906998158379374,
"train_speed(iter/s)": 0.224894
},
{
"epoch": 2.1899075500770415,
"grad_norm": 0.9743887782096863,
"learning_rate": 2.3309964632080448e-05,
"loss": 1.7943431854248046,
"memory(GiB)": 136.87,
"step": 5685,
"token_acc": 0.5755673587638822,
"train_speed(iter/s)": 0.224738
},
{
"epoch": 2.1918335901386747,
"grad_norm": 0.9789854288101196,
"learning_rate": 2.320667804150682e-05,
"loss": 1.74476318359375,
"memory(GiB)": 136.87,
"step": 5690,
"token_acc": 0.6029879990203282,
"train_speed(iter/s)": 0.224844
},
{
"epoch": 2.193759630200308,
"grad_norm": 0.6164162755012512,
"learning_rate": 2.3103568596253406e-05,
"loss": 1.7530014038085937,
"memory(GiB)": 136.87,
"step": 5695,
"token_acc": 0.5818520049607275,
"train_speed(iter/s)": 0.224664
},
{
"epoch": 2.1956856702619416,
"grad_norm": 0.8012659549713135,
"learning_rate": 2.3000636761166483e-05,
"loss": 1.7739967346191405,
"memory(GiB)": 136.87,
"step": 5700,
"token_acc": 0.5790038643194504,
"train_speed(iter/s)": 0.224766
},
{
"epoch": 2.197611710323575,
"grad_norm": 1.168314814567566,
"learning_rate": 2.289788300029167e-05,
"loss": 1.763479995727539,
"memory(GiB)": 136.87,
"step": 5705,
"token_acc": 0.5948987246811703,
"train_speed(iter/s)": 0.224873
},
{
"epoch": 2.199537750385208,
"grad_norm": 0.5416064262390137,
"learning_rate": 2.2795307776871722e-05,
"loss": 1.7594837188720702,
"memory(GiB)": 136.87,
"step": 5710,
"token_acc": 0.579345648787002,
"train_speed(iter/s)": 0.224755
},
{
"epoch": 2.2014637904468413,
"grad_norm": 0.7491913437843323,
"learning_rate": 2.2692911553344562e-05,
"loss": 1.7440570831298827,
"memory(GiB)": 136.87,
"step": 5715,
"token_acc": 0.614974686917133,
"train_speed(iter/s)": 0.224861
},
{
"epoch": 2.2033898305084745,
"grad_norm": 0.8597451448440552,
"learning_rate": 2.2590694791341077e-05,
"loss": 1.7954248428344726,
"memory(GiB)": 136.87,
"step": 5720,
"token_acc": 0.5998505976095617,
"train_speed(iter/s)": 0.224783
},
{
"epoch": 2.2053158705701077,
"grad_norm": 0.8029189109802246,
"learning_rate": 2.2488657951683088e-05,
"loss": 1.7311023712158202,
"memory(GiB)": 136.87,
"step": 5725,
"token_acc": 0.6099334995843724,
"train_speed(iter/s)": 0.224889
},
{
"epoch": 2.2072419106317414,
"grad_norm": 1.3154871463775635,
"learning_rate": 2.238680149438132e-05,
"loss": 1.7625280380249024,
"memory(GiB)": 136.87,
"step": 5730,
"token_acc": 0.5704955820207452,
"train_speed(iter/s)": 0.224855
},
{
"epoch": 2.2091679506933746,
"grad_norm": 1.3025659322738647,
"learning_rate": 2.2285125878633252e-05,
"loss": 1.744378662109375,
"memory(GiB)": 136.87,
"step": 5735,
"token_acc": 0.5831643002028397,
"train_speed(iter/s)": 0.224958
},
{
"epoch": 2.211093990755008,
"grad_norm": 0.5923758149147034,
"learning_rate": 2.2183631562821125e-05,
"loss": 1.741799545288086,
"memory(GiB)": 136.87,
"step": 5740,
"token_acc": 0.5941550190597205,
"train_speed(iter/s)": 0.225066
},
{
"epoch": 2.213020030816641,
"grad_norm": 0.7142196893692017,
"learning_rate": 2.2082319004509765e-05,
"loss": 1.6759931564331054,
"memory(GiB)": 136.87,
"step": 5745,
"token_acc": 0.6022566995768688,
"train_speed(iter/s)": 0.224828
},
{
"epoch": 2.214946070878274,
"grad_norm": 0.5992212891578674,
"learning_rate": 2.1981188660444582e-05,
"loss": 1.7082429885864259,
"memory(GiB)": 136.87,
"step": 5750,
"token_acc": 0.610844892812106,
"train_speed(iter/s)": 0.224932
},
{
"epoch": 2.2168721109399074,
"grad_norm": 0.7615183591842651,
"learning_rate": 2.1880240986549588e-05,
"loss": 1.786642837524414,
"memory(GiB)": 136.87,
"step": 5755,
"token_acc": 0.5765016233766234,
"train_speed(iter/s)": 0.224777
},
{
"epoch": 2.2187981510015407,
"grad_norm": 1.2968544960021973,
"learning_rate": 2.1779476437925176e-05,
"loss": 1.735111618041992,
"memory(GiB)": 136.87,
"step": 5760,
"token_acc": 0.5931955750365269,
"train_speed(iter/s)": 0.22488
},
{
"epoch": 2.2207241910631743,
"grad_norm": 0.6040327548980713,
"learning_rate": 2.1678895468846258e-05,
"loss": 1.8075164794921874,
"memory(GiB)": 136.87,
"step": 5765,
"token_acc": 0.5860338699560945,
"train_speed(iter/s)": 0.224981
},
{
"epoch": 2.2226502311248075,
"grad_norm": 1.311569333076477,
"learning_rate": 2.1578498532760005e-05,
"loss": 1.719764518737793,
"memory(GiB)": 136.87,
"step": 5770,
"token_acc": 0.6135014836795252,
"train_speed(iter/s)": 0.224999
},
{
"epoch": 2.2245762711864407,
"grad_norm": 1.056206226348877,
"learning_rate": 2.1478286082284005e-05,
"loss": 1.7587699890136719,
"memory(GiB)": 136.87,
"step": 5775,
"token_acc": 0.5957149510945505,
"train_speed(iter/s)": 0.225106
},
{
"epoch": 2.226502311248074,
"grad_norm": 1.0323842763900757,
"learning_rate": 2.1378258569204118e-05,
"loss": 1.737189483642578,
"memory(GiB)": 136.87,
"step": 5780,
"token_acc": 0.5930877078578415,
"train_speed(iter/s)": 0.225106
},
{
"epoch": 2.228428351309707,
"grad_norm": 0.7793471813201904,
"learning_rate": 2.1278416444472397e-05,
"loss": 1.7449146270751954,
"memory(GiB)": 136.87,
"step": 5785,
"token_acc": 0.570738255033557,
"train_speed(iter/s)": 0.225212
},
{
"epoch": 2.2303543913713404,
"grad_norm": 0.9886042475700378,
"learning_rate": 2.1178760158205204e-05,
"loss": 1.7651954650878907,
"memory(GiB)": 136.87,
"step": 5790,
"token_acc": 0.5648300117233295,
"train_speed(iter/s)": 0.225128
},
{
"epoch": 2.2322804314329736,
"grad_norm": 0.7703076004981995,
"learning_rate": 2.1079290159681004e-05,
"loss": 1.769308090209961,
"memory(GiB)": 136.87,
"step": 5795,
"token_acc": 0.571583514099783,
"train_speed(iter/s)": 0.225234
},
{
"epoch": 2.2342064714946073,
"grad_norm": 0.6322337985038757,
"learning_rate": 2.098000689733845e-05,
"loss": 1.709291648864746,
"memory(GiB)": 136.87,
"step": 5800,
"token_acc": 0.576911544227886,
"train_speed(iter/s)": 0.225337
},
{
"epoch": 2.2361325115562405,
"grad_norm": 0.6153098940849304,
"learning_rate": 2.088091081877438e-05,
"loss": 1.7767284393310547,
"memory(GiB)": 136.87,
"step": 5805,
"token_acc": 0.5846661589235846,
"train_speed(iter/s)": 0.225185
},
{
"epoch": 2.2380585516178737,
"grad_norm": 1.0357624292373657,
"learning_rate": 2.078200237074168e-05,
"loss": 1.7777097702026368,
"memory(GiB)": 136.87,
"step": 5810,
"token_acc": 0.576578453844551,
"train_speed(iter/s)": 0.225288
},
{
"epoch": 2.239984591679507,
"grad_norm": 1.0849571228027344,
"learning_rate": 2.068328199914741e-05,
"loss": 1.7909885406494142,
"memory(GiB)": 136.87,
"step": 5815,
"token_acc": 0.5976318622174381,
"train_speed(iter/s)": 0.225109
},
{
"epoch": 2.24191063174114,
"grad_norm": 0.8185885548591614,
"learning_rate": 2.0584750149050724e-05,
"loss": 1.7212383270263671,
"memory(GiB)": 136.87,
"step": 5820,
"token_acc": 0.5954932673811487,
"train_speed(iter/s)": 0.225213
},
{
"epoch": 2.2438366718027734,
"grad_norm": 0.9814592003822327,
"learning_rate": 2.0486407264660798e-05,
"loss": 1.8037248611450196,
"memory(GiB)": 136.87,
"step": 5825,
"token_acc": 0.5645435244161359,
"train_speed(iter/s)": 0.225317
},
{
"epoch": 2.2457627118644066,
"grad_norm": 0.7732944488525391,
"learning_rate": 2.0388253789334995e-05,
"loss": 1.7740798950195313,
"memory(GiB)": 136.87,
"step": 5830,
"token_acc": 0.6174626145682586,
"train_speed(iter/s)": 0.225245
},
{
"epoch": 2.2476887519260402,
"grad_norm": 2.3589956760406494,
"learning_rate": 2.0290290165576686e-05,
"loss": 1.7364799499511718,
"memory(GiB)": 136.87,
"step": 5835,
"token_acc": 0.5989328590484659,
"train_speed(iter/s)": 0.225349
},
{
"epoch": 2.2496147919876734,
"grad_norm": 0.8114894032478333,
"learning_rate": 2.0192516835033405e-05,
"loss": 1.7586339950561523,
"memory(GiB)": 136.87,
"step": 5840,
"token_acc": 0.5891400605919366,
"train_speed(iter/s)": 0.225158
},
{
"epoch": 2.2515408320493067,
"grad_norm": 1.414918303489685,
"learning_rate": 2.009493423849474e-05,
"loss": 1.6632991790771485,
"memory(GiB)": 136.87,
"step": 5845,
"token_acc": 0.6072786529060293,
"train_speed(iter/s)": 0.225264
},
{
"epoch": 2.25346687211094,
"grad_norm": 1.3454980850219727,
"learning_rate": 1.9997542815890403e-05,
"loss": 1.7303869247436523,
"memory(GiB)": 136.87,
"step": 5850,
"token_acc": 0.5920074349442379,
"train_speed(iter/s)": 0.225296
},
{
"epoch": 2.255392912172573,
"grad_norm": 0.6571111679077148,
"learning_rate": 1.990034300628826e-05,
"loss": 1.7632432937622071,
"memory(GiB)": 136.87,
"step": 5855,
"token_acc": 0.6028387787895019,
"train_speed(iter/s)": 0.225399
},
{
"epoch": 2.2573189522342063,
"grad_norm": 1.9203803539276123,
"learning_rate": 1.9803335247892337e-05,
"loss": 1.7730270385742188,
"memory(GiB)": 136.87,
"step": 5860,
"token_acc": 0.5724017127286882,
"train_speed(iter/s)": 0.225502
},
{
"epoch": 2.25924499229584,
"grad_norm": 1.38410484790802,
"learning_rate": 1.970651997804085e-05,
"loss": 1.7617721557617188,
"memory(GiB)": 136.87,
"step": 5865,
"token_acc": 0.599640933572711,
"train_speed(iter/s)": 0.225419
},
{
"epoch": 2.261171032357473,
"grad_norm": 1.0010985136032104,
"learning_rate": 1.9609897633204157e-05,
"loss": 1.752220916748047,
"memory(GiB)": 136.87,
"step": 5870,
"token_acc": 0.5799797775530839,
"train_speed(iter/s)": 0.225523
},
{
"epoch": 2.2630970724191064,
"grad_norm": 0.9653367400169373,
"learning_rate": 1.9513468648982903e-05,
"loss": 1.8167720794677735,
"memory(GiB)": 136.87,
"step": 5875,
"token_acc": 0.5817055740828966,
"train_speed(iter/s)": 0.225402
},
{
"epoch": 2.2650231124807396,
"grad_norm": 0.9891018867492676,
"learning_rate": 1.9417233460106035e-05,
"loss": 1.7467689514160156,
"memory(GiB)": 136.87,
"step": 5880,
"token_acc": 0.5769230769230769,
"train_speed(iter/s)": 0.225503
},
{
"epoch": 2.266949152542373,
"grad_norm": 0.7973118424415588,
"learning_rate": 1.932119250042874e-05,
"loss": 1.777346420288086,
"memory(GiB)": 136.87,
"step": 5885,
"token_acc": 0.5731962687987816,
"train_speed(iter/s)": 0.225605
},
{
"epoch": 2.268875192604006,
"grad_norm": 1.1933033466339111,
"learning_rate": 1.9225346202930662e-05,
"loss": 1.7208393096923829,
"memory(GiB)": 136.87,
"step": 5890,
"token_acc": 0.5904145077720208,
"train_speed(iter/s)": 0.225464
},
{
"epoch": 2.2708012326656393,
"grad_norm": 0.6677148938179016,
"learning_rate": 1.912969499971376e-05,
"loss": 1.7478357315063477,
"memory(GiB)": 136.87,
"step": 5895,
"token_acc": 0.576702591148819,
"train_speed(iter/s)": 0.225567
},
{
"epoch": 2.2727272727272725,
"grad_norm": 0.9810054302215576,
"learning_rate": 1.903423932200051e-05,
"loss": 1.753171157836914,
"memory(GiB)": 136.87,
"step": 5900,
"token_acc": 0.5840818884478797,
"train_speed(iter/s)": 0.225514
},
{
"epoch": 2.274653312788906,
"grad_norm": 0.8484246730804443,
"learning_rate": 1.8938979600131912e-05,
"loss": 1.7563274383544922,
"memory(GiB)": 136.87,
"step": 5905,
"token_acc": 0.5948657421068162,
"train_speed(iter/s)": 0.225619
},
{
"epoch": 2.2765793528505394,
"grad_norm": 1.4688133001327515,
"learning_rate": 1.8843916263565484e-05,
"loss": 1.7640121459960938,
"memory(GiB)": 136.87,
"step": 5910,
"token_acc": 0.6093247588424437,
"train_speed(iter/s)": 0.225517
},
{
"epoch": 2.2785053929121726,
"grad_norm": 0.880670964717865,
"learning_rate": 1.8749049740873458e-05,
"loss": 1.734806442260742,
"memory(GiB)": 136.87,
"step": 5915,
"token_acc": 0.5800039753528126,
"train_speed(iter/s)": 0.225618
},
{
"epoch": 2.280431432973806,
"grad_norm": 1.296202540397644,
"learning_rate": 1.865438045974071e-05,
"loss": 1.7341510772705078,
"memory(GiB)": 136.87,
"step": 5920,
"token_acc": 0.5931729155008394,
"train_speed(iter/s)": 0.225722
},
{
"epoch": 2.282357473035439,
"grad_norm": 1.7748517990112305,
"learning_rate": 1.8559908846962905e-05,
"loss": 1.7110935211181642,
"memory(GiB)": 136.87,
"step": 5925,
"token_acc": 0.6011699016219091,
"train_speed(iter/s)": 0.225507
},
{
"epoch": 2.2842835130970722,
"grad_norm": 1.1858643293380737,
"learning_rate": 1.846563532844462e-05,
"loss": 1.682388687133789,
"memory(GiB)": 136.87,
"step": 5930,
"token_acc": 0.610774818401937,
"train_speed(iter/s)": 0.225608
},
{
"epoch": 2.286209553158706,
"grad_norm": 0.6789790987968445,
"learning_rate": 1.8371560329197298e-05,
"loss": 1.7419265747070312,
"memory(GiB)": 136.87,
"step": 5935,
"token_acc": 0.584741550695825,
"train_speed(iter/s)": 0.225561
},
{
"epoch": 2.288135593220339,
"grad_norm": 1.6734957695007324,
"learning_rate": 1.8277684273337433e-05,
"loss": 1.746148681640625,
"memory(GiB)": 136.87,
"step": 5940,
"token_acc": 0.5894994559303591,
"train_speed(iter/s)": 0.225662
},
{
"epoch": 2.2900616332819723,
"grad_norm": 2.039332628250122,
"learning_rate": 1.818400758408465e-05,
"loss": 1.760708999633789,
"memory(GiB)": 136.87,
"step": 5945,
"token_acc": 0.5976346250629089,
"train_speed(iter/s)": 0.225763
},
{
"epoch": 2.2919876733436055,
"grad_norm": 0.8121992945671082,
"learning_rate": 1.8090530683759718e-05,
"loss": 1.7822078704833983,
"memory(GiB)": 136.87,
"step": 5950,
"token_acc": 0.5799952595401754,
"train_speed(iter/s)": 0.225573
},
{
"epoch": 2.2939137134052388,
"grad_norm": 0.6728527545928955,
"learning_rate": 1.7997253993782757e-05,
"loss": 1.7837051391601562,
"memory(GiB)": 136.87,
"step": 5955,
"token_acc": 0.5955346650998825,
"train_speed(iter/s)": 0.225674
},
{
"epoch": 2.295839753466872,
"grad_norm": 0.7240466475486755,
"learning_rate": 1.7904177934671222e-05,
"loss": 1.7575838088989257,
"memory(GiB)": 136.87,
"step": 5960,
"token_acc": 0.5828865058087578,
"train_speed(iter/s)": 0.22553
},
{
"epoch": 2.297765793528505,
"grad_norm": 0.840474545955658,
"learning_rate": 1.7811302926038152e-05,
"loss": 1.6996446609497071,
"memory(GiB)": 136.87,
"step": 5965,
"token_acc": 0.6212999694842845,
"train_speed(iter/s)": 0.225632
},
{
"epoch": 2.299691833590139,
"grad_norm": 1.001343011856079,
"learning_rate": 1.7718629386590106e-05,
"loss": 1.794900894165039,
"memory(GiB)": 136.87,
"step": 5970,
"token_acc": 0.5808986005401424,
"train_speed(iter/s)": 0.225618
},
{
"epoch": 2.301617873651772,
"grad_norm": 0.9903811812400818,
"learning_rate": 1.7626157734125397e-05,
"loss": 1.7136863708496093,
"memory(GiB)": 136.87,
"step": 5975,
"token_acc": 0.5898409684310467,
"train_speed(iter/s)": 0.225719
},
{
"epoch": 2.3035439137134053,
"grad_norm": 0.73136305809021,
"learning_rate": 1.7533888385532208e-05,
"loss": 1.7575675964355468,
"memory(GiB)": 136.87,
"step": 5980,
"token_acc": 0.5941320293398533,
"train_speed(iter/s)": 0.225821
},
{
"epoch": 2.3054699537750385,
"grad_norm": 1.6091309785842896,
"learning_rate": 1.744182175678663e-05,
"loss": 1.758076286315918,
"memory(GiB)": 136.87,
"step": 5985,
"token_acc": 0.5915687629578438,
"train_speed(iter/s)": 0.225867
},
{
"epoch": 2.3073959938366717,
"grad_norm": 0.6056050658226013,
"learning_rate": 1.7349958262950855e-05,
"loss": 1.751551055908203,
"memory(GiB)": 136.87,
"step": 5990,
"token_acc": 0.6008492569002123,
"train_speed(iter/s)": 0.225967
},
{
"epoch": 2.309322033898305,
"grad_norm": 0.6723023056983948,
"learning_rate": 1.725829831817132e-05,
"loss": 1.7882888793945313,
"memory(GiB)": 136.87,
"step": 5995,
"token_acc": 0.5942641173855047,
"train_speed(iter/s)": 0.225917
},
{
"epoch": 2.3112480739599386,
"grad_norm": 0.8164248466491699,
"learning_rate": 1.7166842335676732e-05,
"loss": 1.7342914581298827,
"memory(GiB)": 136.87,
"step": 6000,
"token_acc": 0.5949027498323273,
"train_speed(iter/s)": 0.226011
},
{
"epoch": 2.313174114021572,
"grad_norm": 0.5911799073219299,
"learning_rate": 1.7075590727776362e-05,
"loss": 1.6702856063842773,
"memory(GiB)": 136.87,
"step": 6005,
"token_acc": 0.5983926521239954,
"train_speed(iter/s)": 0.22526
},
{
"epoch": 2.315100154083205,
"grad_norm": 0.9384279251098633,
"learning_rate": 1.698454390585804e-05,
"loss": 1.773263168334961,
"memory(GiB)": 136.87,
"step": 6010,
"token_acc": 0.5634699562276164,
"train_speed(iter/s)": 0.22536
},
{
"epoch": 2.3170261941448382,
"grad_norm": 1.1177493333816528,
"learning_rate": 1.6893702280386363e-05,
"loss": 1.7437713623046875,
"memory(GiB)": 136.87,
"step": 6015,
"token_acc": 0.6100096711798839,
"train_speed(iter/s)": 0.22546
},
{
"epoch": 2.3189522342064715,
"grad_norm": 0.838968813419342,
"learning_rate": 1.6803066260900905e-05,
"loss": 1.8066473007202148,
"memory(GiB)": 136.87,
"step": 6020,
"token_acc": 0.5872020075282308,
"train_speed(iter/s)": 0.225488
},
{
"epoch": 2.3208782742681047,
"grad_norm": 0.774046003818512,
"learning_rate": 1.671263625601424e-05,
"loss": 1.7300872802734375,
"memory(GiB)": 136.87,
"step": 6025,
"token_acc": 0.6225204200700116,
"train_speed(iter/s)": 0.225591
},
{
"epoch": 2.322804314329738,
"grad_norm": 0.9364326000213623,
"learning_rate": 1.662241267341022e-05,
"loss": 1.6646751403808593,
"memory(GiB)": 136.87,
"step": 6030,
"token_acc": 0.5790805567271193,
"train_speed(iter/s)": 0.225469
},
{
"epoch": 2.324730354391371,
"grad_norm": 0.8198605179786682,
"learning_rate": 1.6532395919842084e-05,
"loss": 1.7699329376220703,
"memory(GiB)": 136.87,
"step": 6035,
"token_acc": 0.6019995239228755,
"train_speed(iter/s)": 0.225571
},
{
"epoch": 2.3266563944530048,
"grad_norm": 0.7392686009407043,
"learning_rate": 1.6442586401130574e-05,
"loss": 1.7544296264648438,
"memory(GiB)": 136.87,
"step": 6040,
"token_acc": 0.575739165654111,
"train_speed(iter/s)": 0.225673
},
{
"epoch": 2.328582434514638,
"grad_norm": 1.1457183361053467,
"learning_rate": 1.6352984522162253e-05,
"loss": 1.8268362045288087,
"memory(GiB)": 136.87,
"step": 6045,
"token_acc": 0.5639048038783605,
"train_speed(iter/s)": 0.225473
},
{
"epoch": 2.330508474576271,
"grad_norm": 0.7890773415565491,
"learning_rate": 1.626359068688747e-05,
"loss": 1.7481292724609374,
"memory(GiB)": 136.87,
"step": 6050,
"token_acc": 0.6093050999105278,
"train_speed(iter/s)": 0.225574
},
{
"epoch": 2.3324345146379044,
"grad_norm": 1.0796722173690796,
"learning_rate": 1.6174405298318776e-05,
"loss": 1.7914886474609375,
"memory(GiB)": 136.87,
"step": 6055,
"token_acc": 0.5848470363288719,
"train_speed(iter/s)": 0.225438
},
{
"epoch": 2.3343605546995376,
"grad_norm": 1.3864635229110718,
"learning_rate": 1.608542875852889e-05,
"loss": 1.738632583618164,
"memory(GiB)": 136.87,
"step": 6060,
"token_acc": 0.5878249841471148,
"train_speed(iter/s)": 0.225536
},
{
"epoch": 2.336286594761171,
"grad_norm": 0.78621506690979,
"learning_rate": 1.5996661468649017e-05,
"loss": 1.7501712799072267,
"memory(GiB)": 136.87,
"step": 6065,
"token_acc": 0.593601383484652,
"train_speed(iter/s)": 0.225638
},
{
"epoch": 2.3382126348228045,
"grad_norm": 0.849509596824646,
"learning_rate": 1.590810382886701e-05,
"loss": 1.7106464385986329,
"memory(GiB)": 136.87,
"step": 6070,
"token_acc": 0.610813041683863,
"train_speed(iter/s)": 0.225544
},
{
"epoch": 2.3401386748844377,
"grad_norm": 1.2895069122314453,
"learning_rate": 1.581975623842556e-05,
"loss": 1.706148910522461,
"memory(GiB)": 136.87,
"step": 6075,
"token_acc": 0.5795330171470267,
"train_speed(iter/s)": 0.225643
},
{
"epoch": 2.342064714946071,
"grad_norm": 0.769138753414154,
"learning_rate": 1.573161909562041e-05,
"loss": 1.7505435943603516,
"memory(GiB)": 136.87,
"step": 6080,
"token_acc": 0.6137651821862348,
"train_speed(iter/s)": 0.225519
},
{
"epoch": 2.343990755007704,
"grad_norm": 1.3817111253738403,
"learning_rate": 1.5643692797798516e-05,
"loss": 1.8061553955078125,
"memory(GiB)": 136.87,
"step": 6085,
"token_acc": 0.6187619307335697,
"train_speed(iter/s)": 0.225617
},
{
"epoch": 2.3459167950693374,
"grad_norm": 0.9270229339599609,
"learning_rate": 1.5555977741356282e-05,
"loss": 1.7776214599609375,
"memory(GiB)": 136.87,
"step": 6090,
"token_acc": 0.5748600746268657,
"train_speed(iter/s)": 0.225446
},
{
"epoch": 2.3478428351309706,
"grad_norm": 1.0285189151763916,
"learning_rate": 1.546847432173782e-05,
"loss": 1.7487245559692384,
"memory(GiB)": 136.87,
"step": 6095,
"token_acc": 0.5871774824081314,
"train_speed(iter/s)": 0.225544
},
{
"epoch": 2.349768875192604,
"grad_norm": 3.281270980834961,
"learning_rate": 1.5381182933433068e-05,
"loss": 1.7786136627197267,
"memory(GiB)": 136.87,
"step": 6100,
"token_acc": 0.593194625054183,
"train_speed(iter/s)": 0.225642
},
{
"epoch": 2.3516949152542375,
"grad_norm": 0.7258989214897156,
"learning_rate": 1.5294103969976125e-05,
"loss": 1.7754228591918946,
"memory(GiB)": 136.87,
"step": 6105,
"token_acc": 0.5885826771653543,
"train_speed(iter/s)": 0.22548
},
{
"epoch": 2.3536209553158707,
"grad_norm": 0.728654146194458,
"learning_rate": 1.5207237823943363e-05,
"loss": 1.7477882385253907,
"memory(GiB)": 136.87,
"step": 6110,
"token_acc": 0.5984008253804488,
"train_speed(iter/s)": 0.22558
},
{
"epoch": 2.355546995377504,
"grad_norm": 1.178024172782898,
"learning_rate": 1.5120584886951762e-05,
"loss": 1.7573772430419923,
"memory(GiB)": 136.87,
"step": 6115,
"token_acc": 0.6066613798572561,
"train_speed(iter/s)": 0.225442
},
{
"epoch": 2.357473035439137,
"grad_norm": 0.8227279186248779,
"learning_rate": 1.5034145549657083e-05,
"loss": 1.7448158264160156,
"memory(GiB)": 136.87,
"step": 6120,
"token_acc": 0.5971634735008708,
"train_speed(iter/s)": 0.225544
},
{
"epoch": 2.3593990755007703,
"grad_norm": 0.6402755975723267,
"learning_rate": 1.4947920201752077e-05,
"loss": 1.7440561294555663,
"memory(GiB)": 136.87,
"step": 6125,
"token_acc": 0.5971577726218097,
"train_speed(iter/s)": 0.225642
},
{
"epoch": 2.3613251155624035,
"grad_norm": 0.6562501192092896,
"learning_rate": 1.4861909231964843e-05,
"loss": 1.7098701477050782,
"memory(GiB)": 136.87,
"step": 6130,
"token_acc": 0.5955671447196871,
"train_speed(iter/s)": 0.225484
},
{
"epoch": 2.363251155624037,
"grad_norm": 0.7249884009361267,
"learning_rate": 1.4776113028056953e-05,
"loss": 1.7917041778564453,
"memory(GiB)": 136.87,
"step": 6135,
"token_acc": 0.5886325267304445,
"train_speed(iter/s)": 0.225581
},
{
"epoch": 2.3651771956856704,
"grad_norm": 1.0918840169906616,
"learning_rate": 1.4690531976821742e-05,
"loss": 1.7397417068481444,
"memory(GiB)": 136.87,
"step": 6140,
"token_acc": 0.5955414012738853,
"train_speed(iter/s)": 0.225479
},
{
"epoch": 2.3671032357473036,
"grad_norm": 0.8833898901939392,
"learning_rate": 1.4605166464082637e-05,
"loss": 1.7727884292602538,
"memory(GiB)": 136.87,
"step": 6145,
"token_acc": 0.5727510087823404,
"train_speed(iter/s)": 0.225577
},
{
"epoch": 2.369029275808937,
"grad_norm": 0.7825679183006287,
"learning_rate": 1.4520016874691289e-05,
"loss": 1.7732353210449219,
"memory(GiB)": 136.87,
"step": 6150,
"token_acc": 0.5803498779495525,
"train_speed(iter/s)": 0.225406
},
{
"epoch": 2.37095531587057,
"grad_norm": 0.5326597690582275,
"learning_rate": 1.4435083592525954e-05,
"loss": 1.7631011962890626,
"memory(GiB)": 136.87,
"step": 6155,
"token_acc": 0.6136307918607502,
"train_speed(iter/s)": 0.225503
},
{
"epoch": 2.3728813559322033,
"grad_norm": 1.886215329170227,
"learning_rate": 1.4350367000489716e-05,
"loss": 1.7412738800048828,
"memory(GiB)": 136.87,
"step": 6160,
"token_acc": 0.5984,
"train_speed(iter/s)": 0.225602
},
{
"epoch": 2.3748073959938365,
"grad_norm": 0.8209748864173889,
"learning_rate": 1.4265867480508704e-05,
"loss": 1.7805303573608398,
"memory(GiB)": 136.87,
"step": 6165,
"token_acc": 0.5844707988364287,
"train_speed(iter/s)": 0.225511
},
{
"epoch": 2.3767334360554697,
"grad_norm": 0.9563490152359009,
"learning_rate": 1.4181585413530498e-05,
"loss": 1.7138477325439454,
"memory(GiB)": 136.87,
"step": 6170,
"token_acc": 0.6115280696487542,
"train_speed(iter/s)": 0.22561
},
{
"epoch": 2.3786594761171034,
"grad_norm": 0.6651891469955444,
"learning_rate": 1.4097521179522275e-05,
"loss": 1.7427173614501954,
"memory(GiB)": 136.87,
"step": 6175,
"token_acc": 0.6088790678987546,
"train_speed(iter/s)": 0.225424
},
{
"epoch": 2.3805855161787366,
"grad_norm": 0.8884119391441345,
"learning_rate": 1.4013675157469221e-05,
"loss": 1.720941925048828,
"memory(GiB)": 136.87,
"step": 6180,
"token_acc": 0.5826004278583313,
"train_speed(iter/s)": 0.225524
},
{
"epoch": 2.38251155624037,
"grad_norm": 0.7243108749389648,
"learning_rate": 1.3930047725372701e-05,
"loss": 1.751499557495117,
"memory(GiB)": 136.87,
"step": 6185,
"token_acc": 0.597666378565255,
"train_speed(iter/s)": 0.22562
},
{
"epoch": 2.384437596302003,
"grad_norm": 0.9080860614776611,
"learning_rate": 1.3846639260248643e-05,
"loss": 1.7844144821166992,
"memory(GiB)": 136.87,
"step": 6190,
"token_acc": 0.5806381118881119,
"train_speed(iter/s)": 0.225561
},
{
"epoch": 2.3863636363636362,
"grad_norm": 0.7291045784950256,
"learning_rate": 1.3763450138125813e-05,
"loss": 1.7495555877685547,
"memory(GiB)": 136.87,
"step": 6195,
"token_acc": 0.5659421818949145,
"train_speed(iter/s)": 0.225657
},
{
"epoch": 2.3882896764252695,
"grad_norm": 0.7702904939651489,
"learning_rate": 1.368048073404412e-05,
"loss": 1.7903865814208983,
"memory(GiB)": 136.87,
"step": 6200,
"token_acc": 0.5870870870870871,
"train_speed(iter/s)": 0.225496
},
{
"epoch": 2.390215716486903,
"grad_norm": 0.9907333254814148,
"learning_rate": 1.359773142205293e-05,
"loss": 1.7470645904541016,
"memory(GiB)": 136.87,
"step": 6205,
"token_acc": 0.6155070486584812,
"train_speed(iter/s)": 0.225591
},
{
"epoch": 2.3921417565485363,
"grad_norm": 0.8636792302131653,
"learning_rate": 1.351520257520935e-05,
"loss": 1.7163467407226562,
"memory(GiB)": 136.87,
"step": 6210,
"token_acc": 0.5800691244239631,
"train_speed(iter/s)": 0.225355
},
{
"epoch": 2.3940677966101696,
"grad_norm": 1.0127636194229126,
"learning_rate": 1.3432894565576552e-05,
"loss": 1.7046619415283204,
"memory(GiB)": 136.87,
"step": 6215,
"token_acc": 0.6136825468503048,
"train_speed(iter/s)": 0.22545
},
{
"epoch": 2.3959938366718028,
"grad_norm": 1.10391104221344,
"learning_rate": 1.3350807764222178e-05,
"loss": 1.7188854217529297,
"memory(GiB)": 136.87,
"step": 6220,
"token_acc": 0.606425702811245,
"train_speed(iter/s)": 0.225547
},
{
"epoch": 2.397919876733436,
"grad_norm": 0.7892981171607971,
"learning_rate": 1.3268942541216522e-05,
"loss": 1.7245141983032226,
"memory(GiB)": 136.87,
"step": 6225,
"token_acc": 0.6054570259208731,
"train_speed(iter/s)": 0.225414
},
{
"epoch": 2.399845916795069,
"grad_norm": 0.9871103167533875,
"learning_rate": 1.3187299265631017e-05,
"loss": 1.8419445037841797,
"memory(GiB)": 136.87,
"step": 6230,
"token_acc": 0.5904173106646059,
"train_speed(iter/s)": 0.22551
},
{
"epoch": 2.4017719568567024,
"grad_norm": 0.9012895226478577,
"learning_rate": 1.3105878305536418e-05,
"loss": 1.7545204162597656,
"memory(GiB)": 136.87,
"step": 6235,
"token_acc": 0.597794696770806,
"train_speed(iter/s)": 0.225419
},
{
"epoch": 2.403697996918336,
"grad_norm": 0.6132038831710815,
"learning_rate": 1.3024680028001272e-05,
"loss": 1.739631462097168,
"memory(GiB)": 136.87,
"step": 6240,
"token_acc": 0.5967777052035707,
"train_speed(iter/s)": 0.225515
},
{
"epoch": 2.4056240369799693,
"grad_norm": 0.8217525482177734,
"learning_rate": 1.2943704799090226e-05,
"loss": 1.7895318984985351,
"memory(GiB)": 136.87,
"step": 6245,
"token_acc": 0.5860901276374055,
"train_speed(iter/s)": 0.225614
},
{
"epoch": 2.4075500770416025,
"grad_norm": 2.8082449436187744,
"learning_rate": 1.2862952983862301e-05,
"loss": 1.6853967666625977,
"memory(GiB)": 136.87,
"step": 6250,
"token_acc": 0.6029850746268657,
"train_speed(iter/s)": 0.225527
},
{
"epoch": 2.4094761171032357,
"grad_norm": 0.7878751158714294,
"learning_rate": 1.2782424946369324e-05,
"loss": 1.7052642822265625,
"memory(GiB)": 136.87,
"step": 6255,
"token_acc": 0.6001275510204082,
"train_speed(iter/s)": 0.225625
},
{
"epoch": 2.411402157164869,
"grad_norm": 1.1741511821746826,
"learning_rate": 1.2702121049654319e-05,
"loss": 1.7604766845703126,
"memory(GiB)": 136.87,
"step": 6260,
"token_acc": 0.5685633311532592,
"train_speed(iter/s)": 0.225448
},
{
"epoch": 2.413328197226502,
"grad_norm": 1.878864049911499,
"learning_rate": 1.2622041655749754e-05,
"loss": 1.7939418792724608,
"memory(GiB)": 136.87,
"step": 6265,
"token_acc": 0.5861340503168811,
"train_speed(iter/s)": 0.225546
},
{
"epoch": 2.415254237288136,
"grad_norm": 1.1127411127090454,
"learning_rate": 1.254218712567603e-05,
"loss": 1.772989845275879,
"memory(GiB)": 136.87,
"step": 6270,
"token_acc": 0.5840864007053119,
"train_speed(iter/s)": 0.225496
},
{
"epoch": 2.417180277349769,
"grad_norm": 1.7507178783416748,
"learning_rate": 1.2462557819439745e-05,
"loss": 1.786292839050293,
"memory(GiB)": 136.87,
"step": 6275,
"token_acc": 0.5905109489051095,
"train_speed(iter/s)": 0.225593
},
{
"epoch": 2.4191063174114023,
"grad_norm": 0.6418553590774536,
"learning_rate": 1.2383154096032175e-05,
"loss": 1.7871992111206054,
"memory(GiB)": 136.87,
"step": 6280,
"token_acc": 0.5720430107526882,
"train_speed(iter/s)": 0.225691
},
{
"epoch": 2.4210323574730355,
"grad_norm": 0.7897877097129822,
"learning_rate": 1.230397631342759e-05,
"loss": 1.7533956527709962,
"memory(GiB)": 136.87,
"step": 6285,
"token_acc": 0.5893360676749552,
"train_speed(iter/s)": 0.225534
},
{
"epoch": 2.4229583975346687,
"grad_norm": 0.8859832286834717,
"learning_rate": 1.2225024828581622e-05,
"loss": 1.7505607604980469,
"memory(GiB)": 136.87,
"step": 6290,
"token_acc": 0.5698396275219866,
"train_speed(iter/s)": 0.225631
},
{
"epoch": 2.424884437596302,
"grad_norm": 0.7162906527519226,
"learning_rate": 1.2146299997429749e-05,
"loss": 1.765916633605957,
"memory(GiB)": 136.87,
"step": 6295,
"token_acc": 0.6060606060606061,
"train_speed(iter/s)": 0.225552
},
{
"epoch": 2.426810477657935,
"grad_norm": 1.2338824272155762,
"learning_rate": 1.2067802174885589e-05,
"loss": 1.7982860565185548,
"memory(GiB)": 136.87,
"step": 6300,
"token_acc": 0.5928631051752922,
"train_speed(iter/s)": 0.225649
},
{
"epoch": 2.4287365177195683,
"grad_norm": 1.0062686204910278,
"learning_rate": 1.1989531714839318e-05,
"loss": 1.687603759765625,
"memory(GiB)": 136.87,
"step": 6305,
"token_acc": 0.5950574993883044,
"train_speed(iter/s)": 0.225747
},
{
"epoch": 2.430662557781202,
"grad_norm": 0.8818328380584717,
"learning_rate": 1.1911488970156176e-05,
"loss": 1.7602195739746094,
"memory(GiB)": 136.87,
"step": 6310,
"token_acc": 0.6067974578612877,
"train_speed(iter/s)": 0.225563
},
{
"epoch": 2.432588597842835,
"grad_norm": 0.8212074041366577,
"learning_rate": 1.183367429267472e-05,
"loss": 1.788917350769043,
"memory(GiB)": 136.87,
"step": 6315,
"token_acc": 0.6095283696432846,
"train_speed(iter/s)": 0.225659
},
{
"epoch": 2.4345146379044684,
"grad_norm": 1.390724539756775,
"learning_rate": 1.1756088033205373e-05,
"loss": 1.7803215026855468,
"memory(GiB)": 136.87,
"step": 6320,
"token_acc": 0.5860018298261666,
"train_speed(iter/s)": 0.225553
},
{
"epoch": 2.4364406779661016,
"grad_norm": 1.1500554084777832,
"learning_rate": 1.1678730541528744e-05,
"loss": 1.7168159484863281,
"memory(GiB)": 136.87,
"step": 6325,
"token_acc": 0.5908160280783855,
"train_speed(iter/s)": 0.22565
},
{
"epoch": 2.438366718027735,
"grad_norm": 0.8661229014396667,
"learning_rate": 1.160160216639411e-05,
"loss": 1.7641899108886718,
"memory(GiB)": 136.87,
"step": 6330,
"token_acc": 0.5784013204432916,
"train_speed(iter/s)": 0.225461
},
{
"epoch": 2.440292758089368,
"grad_norm": 0.8414490818977356,
"learning_rate": 1.1524703255517854e-05,
"loss": 1.7607059478759766,
"memory(GiB)": 136.87,
"step": 6335,
"token_acc": 0.592836946277097,
"train_speed(iter/s)": 0.225558
},
{
"epoch": 2.4422187981510017,
"grad_norm": 1.1226396560668945,
"learning_rate": 1.1448034155581808e-05,
"loss": 1.7241291046142577,
"memory(GiB)": 136.87,
"step": 6340,
"token_acc": 0.5854690221448121,
"train_speed(iter/s)": 0.225654
},
{
"epoch": 2.444144838212635,
"grad_norm": 0.6753987073898315,
"learning_rate": 1.1371595212231814e-05,
"loss": 1.7629899978637695,
"memory(GiB)": 136.87,
"step": 6345,
"token_acc": 0.6034912718204489,
"train_speed(iter/s)": 0.22549
},
{
"epoch": 2.446070878274268,
"grad_norm": 0.8329557776451111,
"learning_rate": 1.1295386770076064e-05,
"loss": 1.7341716766357422,
"memory(GiB)": 136.87,
"step": 6350,
"token_acc": 0.5967302452316077,
"train_speed(iter/s)": 0.225585
},
{
"epoch": 2.4479969183359014,
"grad_norm": 0.9416248798370361,
"learning_rate": 1.1219409172683576e-05,
"loss": 1.7593303680419923,
"memory(GiB)": 136.87,
"step": 6355,
"token_acc": 0.6022029231095107,
"train_speed(iter/s)": 0.225448
},
{
"epoch": 2.4499229583975346,
"grad_norm": 1.220937967300415,
"learning_rate": 1.1143662762582711e-05,
"loss": 1.6858165740966797,
"memory(GiB)": 136.87,
"step": 6360,
"token_acc": 0.5952595259525952,
"train_speed(iter/s)": 0.225546
},
{
"epoch": 2.451848998459168,
"grad_norm": 0.6591572761535645,
"learning_rate": 1.1068147881259518e-05,
"loss": 1.7599594116210937,
"memory(GiB)": 136.87,
"step": 6365,
"token_acc": 0.5888540734109221,
"train_speed(iter/s)": 0.22564
},
{
"epoch": 2.453775038520801,
"grad_norm": 0.840905487537384,
"learning_rate": 1.0992864869156266e-05,
"loss": 1.7216621398925782,
"memory(GiB)": 136.87,
"step": 6370,
"token_acc": 0.5963777490297542,
"train_speed(iter/s)": 0.225565
},
{
"epoch": 2.4557010785824347,
"grad_norm": 0.8095690011978149,
"learning_rate": 1.0917814065669926e-05,
"loss": 1.7725284576416016,
"memory(GiB)": 136.87,
"step": 6375,
"token_acc": 0.6178283546704599,
"train_speed(iter/s)": 0.225657
},
{
"epoch": 2.457627118644068,
"grad_norm": 0.8278321027755737,
"learning_rate": 1.084299580915054e-05,
"loss": 1.7619709014892577,
"memory(GiB)": 136.87,
"step": 6380,
"token_acc": 0.5774442359808214,
"train_speed(iter/s)": 0.225513
},
{
"epoch": 2.459553158705701,
"grad_norm": 1.1755812168121338,
"learning_rate": 1.0768410436899836e-05,
"loss": 1.768560791015625,
"memory(GiB)": 136.87,
"step": 6385,
"token_acc": 0.6030060120240481,
"train_speed(iter/s)": 0.225609
},
{
"epoch": 2.4614791987673343,
"grad_norm": 1.2380053997039795,
"learning_rate": 1.069405828516956e-05,
"loss": 1.8089324951171875,
"memory(GiB)": 136.87,
"step": 6390,
"token_acc": 0.5924847072531314,
"train_speed(iter/s)": 0.225513
},
{
"epoch": 2.4634052388289676,
"grad_norm": 0.9368924498558044,
"learning_rate": 1.0619939689160114e-05,
"loss": 1.7379064559936523,
"memory(GiB)": 136.87,
"step": 6395,
"token_acc": 0.5945629932768196,
"train_speed(iter/s)": 0.225609
},
{
"epoch": 2.4653312788906008,
"grad_norm": 1.3306682109832764,
"learning_rate": 1.0546054983018908e-05,
"loss": 1.732640266418457,
"memory(GiB)": 136.87,
"step": 6400,
"token_acc": 0.5804279874969944,
"train_speed(iter/s)": 0.225704
},
{
"epoch": 2.4672573189522344,
"grad_norm": 0.7077586054801941,
"learning_rate": 1.0472404499838912e-05,
"loss": 1.7971107482910156,
"memory(GiB)": 136.87,
"step": 6405,
"token_acc": 0.5892661555312158,
"train_speed(iter/s)": 0.225555
},
{
"epoch": 2.4691833590138677,
"grad_norm": 0.7110083699226379,
"learning_rate": 1.0398988571657171e-05,
"loss": 1.7382835388183593,
"memory(GiB)": 136.87,
"step": 6410,
"token_acc": 0.5823636363636364,
"train_speed(iter/s)": 0.225648
},
{
"epoch": 2.471109399075501,
"grad_norm": 0.6605734825134277,
"learning_rate": 1.0325807529453307e-05,
"loss": 1.7629478454589844,
"memory(GiB)": 136.87,
"step": 6415,
"token_acc": 0.5946843853820598,
"train_speed(iter/s)": 0.2255
},
{
"epoch": 2.473035439137134,
"grad_norm": 0.9854040145874023,
"learning_rate": 1.0252861703148e-05,
"loss": 1.7683237075805665,
"memory(GiB)": 136.87,
"step": 6420,
"token_acc": 0.6104114189756508,
"train_speed(iter/s)": 0.225596
},
{
"epoch": 2.4749614791987673,
"grad_norm": 0.8552939295768738,
"learning_rate": 1.0180151421601482e-05,
"loss": 1.7265308380126954,
"memory(GiB)": 136.87,
"step": 6425,
"token_acc": 0.592092803030303,
"train_speed(iter/s)": 0.225691
},
{
"epoch": 2.4768875192604005,
"grad_norm": 2.8793365955352783,
"learning_rate": 1.0107677012612087e-05,
"loss": 1.7507991790771484,
"memory(GiB)": 136.87,
"step": 6430,
"token_acc": 0.6297085998578535,
"train_speed(iter/s)": 0.22553
},
{
"epoch": 2.4788135593220337,
"grad_norm": 1.5658791065216064,
"learning_rate": 1.0035438802914826e-05,
"loss": 1.769890594482422,
"memory(GiB)": 136.87,
"step": 6435,
"token_acc": 0.5688343558282208,
"train_speed(iter/s)": 0.225623
},
{
"epoch": 2.480739599383667,
"grad_norm": 0.9001925587654114,
"learning_rate": 9.963437118179778e-06,
"loss": 1.7269010543823242,
"memory(GiB)": 136.87,
"step": 6440,
"token_acc": 0.6007955161815224,
"train_speed(iter/s)": 0.225469
},
{
"epoch": 2.4826656394453006,
"grad_norm": 0.9512019753456116,
"learning_rate": 9.891672283010773e-06,
"loss": 1.7166770935058593,
"memory(GiB)": 136.87,
"step": 6445,
"token_acc": 0.5868338557993731,
"train_speed(iter/s)": 0.225564
},
{
"epoch": 2.484591679506934,
"grad_norm": 0.8464173674583435,
"learning_rate": 9.820144620943792e-06,
"loss": 1.7656770706176759,
"memory(GiB)": 136.87,
"step": 6450,
"token_acc": 0.5673964653125825,
"train_speed(iter/s)": 0.225359
},
{
"epoch": 2.486517719568567,
"grad_norm": 1.2672311067581177,
"learning_rate": 9.74885445444562e-06,
"loss": 1.7996238708496093,
"memory(GiB)": 136.87,
"step": 6455,
"token_acc": 0.6024713682941532,
"train_speed(iter/s)": 0.225451
},
{
"epoch": 2.4884437596302003,
"grad_norm": 0.8195527195930481,
"learning_rate": 9.677802104912348e-06,
"loss": 1.7584362030029297,
"memory(GiB)": 136.87,
"step": 6460,
"token_acc": 0.5970344526820759,
"train_speed(iter/s)": 0.225545
},
{
"epoch": 2.4903697996918335,
"grad_norm": 2.4658055305480957,
"learning_rate": 9.606987892667868e-06,
"loss": 1.8002706527709962,
"memory(GiB)": 136.87,
"step": 6465,
"token_acc": 0.5632160392798691,
"train_speed(iter/s)": 0.225377
},
{
"epoch": 2.4922958397534667,
"grad_norm": 0.6704517602920532,
"learning_rate": 9.536412136962553e-06,
"loss": 1.716069793701172,
"memory(GiB)": 136.87,
"step": 6470,
"token_acc": 0.6033632286995516,
"train_speed(iter/s)": 0.225471
},
{
"epoch": 2.4942218798151004,
"grad_norm": 1.9474087953567505,
"learning_rate": 9.466075155971692e-06,
"loss": 1.6798561096191407,
"memory(GiB)": 136.87,
"step": 6475,
"token_acc": 0.5969060773480663,
"train_speed(iter/s)": 0.225306
},
{
"epoch": 2.4961479198767336,
"grad_norm": 0.9735795259475708,
"learning_rate": 9.395977266794114e-06,
"loss": 1.7014467239379882,
"memory(GiB)": 136.87,
"step": 6480,
"token_acc": 0.599007561436673,
"train_speed(iter/s)": 0.2254
},
{
"epoch": 2.498073959938367,
"grad_norm": 0.8462166786193848,
"learning_rate": 9.326118785450804e-06,
"loss": 1.7425146102905273,
"memory(GiB)": 136.87,
"step": 6485,
"token_acc": 0.5804161566707466,
"train_speed(iter/s)": 0.225492
},
{
"epoch": 2.5,
"grad_norm": 0.8482344746589661,
"learning_rate": 9.25650002688337e-06,
"loss": 1.7154478073120116,
"memory(GiB)": 136.87,
"step": 6490,
"token_acc": 0.607293868921776,
"train_speed(iter/s)": 0.225466
},
{
"epoch": 2.501926040061633,
"grad_norm": 1.1678473949432373,
"learning_rate": 9.187121304952723e-06,
"loss": 1.7428579330444336,
"memory(GiB)": 136.87,
"step": 6495,
"token_acc": 0.5804252998909487,
"train_speed(iter/s)": 0.22556
},
{
"epoch": 2.5038520801232664,
"grad_norm": 0.6760681867599487,
"learning_rate": 9.117982932437616e-06,
"loss": 1.7458980560302735,
"memory(GiB)": 136.87,
"step": 6500,
"token_acc": 0.5954116638078902,
"train_speed(iter/s)": 0.225455
},
{
"epoch": 2.5057781201848996,
"grad_norm": 0.6083308458328247,
"learning_rate": 9.04908522103321e-06,
"loss": 1.711414909362793,
"memory(GiB)": 136.87,
"step": 6505,
"token_acc": 0.5895454545454546,
"train_speed(iter/s)": 0.225546
},
{
"epoch": 2.507704160246533,
"grad_norm": 0.8596079349517822,
"learning_rate": 8.980428481349743e-06,
"loss": 1.8009174346923829,
"memory(GiB)": 136.87,
"step": 6510,
"token_acc": 0.5869609232638185,
"train_speed(iter/s)": 0.225289
},
{
"epoch": 2.5096302003081665,
"grad_norm": 0.7582442164421082,
"learning_rate": 8.912013022911044e-06,
"loss": 1.73724422454834,
"memory(GiB)": 136.87,
"step": 6515,
"token_acc": 0.5835345773874863,
"train_speed(iter/s)": 0.225377
},
{
"epoch": 2.5115562403697997,
"grad_norm": 0.7155218720436096,
"learning_rate": 8.84383915415319e-06,
"loss": 1.7769826889038085,
"memory(GiB)": 136.87,
"step": 6520,
"token_acc": 0.5947270181987867,
"train_speed(iter/s)": 0.225468
},
{
"epoch": 2.513482280431433,
"grad_norm": 0.9613110423088074,
"learning_rate": 8.775907182423132e-06,
"loss": 1.7796913146972657,
"memory(GiB)": 136.87,
"step": 6525,
"token_acc": 0.6020818547433168,
"train_speed(iter/s)": 0.225322
},
{
"epoch": 2.515408320493066,
"grad_norm": 0.8941595554351807,
"learning_rate": 8.708217413977225e-06,
"loss": 1.707906150817871,
"memory(GiB)": 136.87,
"step": 6530,
"token_acc": 0.6147216398788726,
"train_speed(iter/s)": 0.225414
},
{
"epoch": 2.5173343605546994,
"grad_norm": 1.1471151113510132,
"learning_rate": 8.64077015397996e-06,
"loss": 1.774416732788086,
"memory(GiB)": 136.87,
"step": 6535,
"token_acc": 0.5963346997829756,
"train_speed(iter/s)": 0.225336
},
{
"epoch": 2.519260400616333,
"grad_norm": 1.2513980865478516,
"learning_rate": 8.573565706502529e-06,
"loss": 1.7384067535400392,
"memory(GiB)": 136.87,
"step": 6540,
"token_acc": 0.5839352155832787,
"train_speed(iter/s)": 0.225428
},
{
"epoch": 2.5211864406779663,
"grad_norm": 0.7317337989807129,
"learning_rate": 8.506604374521395e-06,
"loss": 1.7558183670043945,
"memory(GiB)": 136.87,
"step": 6545,
"token_acc": 0.5778357235984355,
"train_speed(iter/s)": 0.22552
},
{
"epoch": 2.5231124807395995,
"grad_norm": 1.2270808219909668,
"learning_rate": 8.439886459917064e-06,
"loss": 1.7726566314697265,
"memory(GiB)": 136.87,
"step": 6550,
"token_acc": 0.6090658076392085,
"train_speed(iter/s)": 0.225358
},
{
"epoch": 2.5250385208012327,
"grad_norm": 0.758371114730835,
"learning_rate": 8.373412263472581e-06,
"loss": 1.7376522064208983,
"memory(GiB)": 136.87,
"step": 6555,
"token_acc": 0.6021108179419525,
"train_speed(iter/s)": 0.225452
},
{
"epoch": 2.526964560862866,
"grad_norm": 0.8149104714393616,
"learning_rate": 8.307182084872313e-06,
"loss": 1.7415027618408203,
"memory(GiB)": 136.87,
"step": 6560,
"token_acc": 0.596769456681351,
"train_speed(iter/s)": 0.225274
},
{
"epoch": 2.528890600924499,
"grad_norm": 0.8776388168334961,
"learning_rate": 8.241196222700475e-06,
"loss": 1.7876569747924804,
"memory(GiB)": 136.87,
"step": 6565,
"token_acc": 0.6002169785733659,
"train_speed(iter/s)": 0.225364
},
{
"epoch": 2.5308166409861323,
"grad_norm": 0.7386429905891418,
"learning_rate": 8.175454974439826e-06,
"loss": 1.7575851440429688,
"memory(GiB)": 136.87,
"step": 6570,
"token_acc": 0.5849456665783196,
"train_speed(iter/s)": 0.225277
},
{
"epoch": 2.5327426810477656,
"grad_norm": 2.3658864498138428,
"learning_rate": 8.10995863647037e-06,
"loss": 1.757291603088379,
"memory(GiB)": 136.87,
"step": 6575,
"token_acc": 0.6094100074682599,
"train_speed(iter/s)": 0.22537
},
{
"epoch": 2.5346687211093992,
"grad_norm": 0.7592331171035767,
"learning_rate": 8.044707504067987e-06,
"loss": 1.767623519897461,
"memory(GiB)": 136.87,
"step": 6580,
"token_acc": 0.595243932336357,
"train_speed(iter/s)": 0.22546
},
{
"epoch": 2.5365947611710324,
"grad_norm": 0.724601686000824,
"learning_rate": 7.979701871403095e-06,
"loss": 1.7439268112182618,
"memory(GiB)": 136.87,
"step": 6585,
"token_acc": 0.5912841670964415,
"train_speed(iter/s)": 0.225285
},
{
"epoch": 2.5385208012326657,
"grad_norm": 1.1232019662857056,
"learning_rate": 7.914942031539307e-06,
"loss": 1.7299232482910156,
"memory(GiB)": 136.87,
"step": 6590,
"token_acc": 0.6041354510038958,
"train_speed(iter/s)": 0.225379
},
{
"epoch": 2.540446841294299,
"grad_norm": 0.7735335826873779,
"learning_rate": 7.850428276432149e-06,
"loss": 1.7614971160888673,
"memory(GiB)": 136.87,
"step": 6595,
"token_acc": 0.5635476342032676,
"train_speed(iter/s)": 0.225222
},
{
"epoch": 2.542372881355932,
"grad_norm": 0.8413936495780945,
"learning_rate": 7.786160896927754e-06,
"loss": 1.720973587036133,
"memory(GiB)": 136.87,
"step": 6600,
"token_acc": 0.6176310043668122,
"train_speed(iter/s)": 0.225312
},
{
"epoch": 2.5442989214175658,
"grad_norm": 1.5853021144866943,
"learning_rate": 7.722140182761468e-06,
"loss": 1.7770484924316405,
"memory(GiB)": 136.87,
"step": 6605,
"token_acc": 0.5979178390545864,
"train_speed(iter/s)": 0.225403
},
{
"epoch": 2.546224961479199,
"grad_norm": 0.8040251135826111,
"learning_rate": 7.658366422556663e-06,
"loss": 1.7803247451782227,
"memory(GiB)": 136.87,
"step": 6610,
"token_acc": 0.5691806836679327,
"train_speed(iter/s)": 0.225277
},
{
"epoch": 2.548151001540832,
"grad_norm": 0.6319120526313782,
"learning_rate": 7.594839903823321e-06,
"loss": 1.7763856887817382,
"memory(GiB)": 136.87,
"step": 6615,
"token_acc": 0.5823383644965082,
"train_speed(iter/s)": 0.225371
},
{
"epoch": 2.5500770416024654,
"grad_norm": 0.789165735244751,
"learning_rate": 7.531560912956835e-06,
"loss": 1.7056188583374023,
"memory(GiB)": 136.87,
"step": 6620,
"token_acc": 0.6102923411452041,
"train_speed(iter/s)": 0.225286
},
{
"epoch": 2.5520030816640986,
"grad_norm": 0.6790891289710999,
"learning_rate": 7.4685297352366234e-06,
"loss": 1.690250778198242,
"memory(GiB)": 136.87,
"step": 6625,
"token_acc": 0.6201143946615825,
"train_speed(iter/s)": 0.225379
},
{
"epoch": 2.553929121725732,
"grad_norm": 1.8280107975006104,
"learning_rate": 7.405746654824935e-06,
"loss": 1.7029668807983398,
"memory(GiB)": 136.87,
"step": 6630,
"token_acc": 0.6112143742255266,
"train_speed(iter/s)": 0.225252
},
{
"epoch": 2.555855161787365,
"grad_norm": 0.7156417369842529,
"learning_rate": 7.343211954765526e-06,
"loss": 1.7556230545043945,
"memory(GiB)": 136.87,
"step": 6635,
"token_acc": 0.6034425686858657,
"train_speed(iter/s)": 0.225343
},
{
"epoch": 2.5577812018489983,
"grad_norm": 0.9100439548492432,
"learning_rate": 7.280925916982359e-06,
"loss": 1.7820247650146483,
"memory(GiB)": 136.87,
"step": 6640,
"token_acc": 0.5686700458604875,
"train_speed(iter/s)": 0.225392
},
{
"epoch": 2.5597072419106315,
"grad_norm": 0.606620192527771,
"learning_rate": 7.218888822278349e-06,
"loss": 1.7377914428710937,
"memory(GiB)": 136.87,
"step": 6645,
"token_acc": 0.57930411206507,
"train_speed(iter/s)": 0.225237
},
{
"epoch": 2.561633281972265,
"grad_norm": 0.6664561629295349,
"learning_rate": 7.157100950334159e-06,
"loss": 1.7779190063476562,
"memory(GiB)": 136.87,
"step": 6650,
"token_acc": 0.5969325153374233,
"train_speed(iter/s)": 0.225286
},
{
"epoch": 2.5635593220338984,
"grad_norm": 1.4106212854385376,
"learning_rate": 7.095562579706817e-06,
"loss": 1.765465545654297,
"memory(GiB)": 136.87,
"step": 6655,
"token_acc": 0.5987389659520808,
"train_speed(iter/s)": 0.225188
},
{
"epoch": 2.5654853620955316,
"grad_norm": 2.486879587173462,
"learning_rate": 7.034273987828591e-06,
"loss": 1.7376438140869142,
"memory(GiB)": 136.87,
"step": 6660,
"token_acc": 0.6282894736842105,
"train_speed(iter/s)": 0.225242
},
{
"epoch": 2.567411402157165,
"grad_norm": 0.8558741211891174,
"learning_rate": 6.97323545100563e-06,
"loss": 1.7216110229492188,
"memory(GiB)": 136.87,
"step": 6665,
"token_acc": 0.5907345789608395,
"train_speed(iter/s)": 0.225333
},
{
"epoch": 2.569337442218798,
"grad_norm": 0.595890998840332,
"learning_rate": 6.912447244416794e-06,
"loss": 1.7243354797363282,
"memory(GiB)": 136.87,
"step": 6670,
"token_acc": 0.617708880714661,
"train_speed(iter/s)": 0.22518
},
{
"epoch": 2.5712634822804317,
"grad_norm": 0.7160053253173828,
"learning_rate": 6.851909642112387e-06,
"loss": 1.7192840576171875,
"memory(GiB)": 136.87,
"step": 6675,
"token_acc": 0.6142281879194631,
"train_speed(iter/s)": 0.225272
},
{
"epoch": 2.573189522342065,
"grad_norm": 0.6273704171180725,
"learning_rate": 6.7916229170128795e-06,
"loss": 1.69462890625,
"memory(GiB)": 136.87,
"step": 6680,
"token_acc": 0.6033733708152312,
"train_speed(iter/s)": 0.225148
},
{
"epoch": 2.575115562403698,
"grad_norm": 0.6916431188583374,
"learning_rate": 6.7315873409077714e-06,
"loss": 1.7108070373535156,
"memory(GiB)": 136.87,
"step": 6685,
"token_acc": 0.6030690537084399,
"train_speed(iter/s)": 0.225239
},
{
"epoch": 2.5770416024653313,
"grad_norm": 0.8680840730667114,
"learning_rate": 6.671803184454269e-06,
"loss": 1.7325355529785156,
"memory(GiB)": 136.87,
"step": 6690,
"token_acc": 0.5755029284441049,
"train_speed(iter/s)": 0.22506
},
{
"epoch": 2.5789676425269645,
"grad_norm": 0.9855715036392212,
"learning_rate": 6.612270717176106e-06,
"loss": 1.7241365432739257,
"memory(GiB)": 136.87,
"step": 6695,
"token_acc": 0.6001224739742804,
"train_speed(iter/s)": 0.225151
},
{
"epoch": 2.5808936825885977,
"grad_norm": 0.7629043459892273,
"learning_rate": 6.552990207462382e-06,
"loss": 1.7361721038818358,
"memory(GiB)": 136.87,
"step": 6700,
"token_acc": 0.5975510204081632,
"train_speed(iter/s)": 0.22524
},
{
"epoch": 2.582819722650231,
"grad_norm": 0.7211050987243652,
"learning_rate": 6.493961922566239e-06,
"loss": 1.7221599578857423,
"memory(GiB)": 136.87,
"step": 6705,
"token_acc": 0.6065820606582061,
"train_speed(iter/s)": 0.22511
},
{
"epoch": 2.584745762711864,
"grad_norm": 0.7319083213806152,
"learning_rate": 6.435186128603762e-06,
"loss": 1.7586380004882813,
"memory(GiB)": 136.87,
"step": 6710,
"token_acc": 0.6046454163577959,
"train_speed(iter/s)": 0.225171
},
{
"epoch": 2.586671802773498,
"grad_norm": 0.733749270439148,
"learning_rate": 6.37666309055273e-06,
"loss": 1.757882308959961,
"memory(GiB)": 136.87,
"step": 6715,
"token_acc": 0.5887734915924827,
"train_speed(iter/s)": 0.225051
},
{
"epoch": 2.588597842835131,
"grad_norm": 0.793056070804596,
"learning_rate": 6.318393072251398e-06,
"loss": 1.7687044143676758,
"memory(GiB)": 136.87,
"step": 6720,
"token_acc": 0.5741165672326756,
"train_speed(iter/s)": 0.225094
},
{
"epoch": 2.5905238828967643,
"grad_norm": 0.863842785358429,
"learning_rate": 6.26037633639738e-06,
"loss": 1.7726699829101562,
"memory(GiB)": 136.87,
"step": 6725,
"token_acc": 0.5722106360792493,
"train_speed(iter/s)": 0.225185
},
{
"epoch": 2.5924499229583975,
"grad_norm": 1.0534777641296387,
"learning_rate": 6.202613144546378e-06,
"loss": 1.7395580291748047,
"memory(GiB)": 136.87,
"step": 6730,
"token_acc": 0.605903470283207,
"train_speed(iter/s)": 0.225139
},
{
"epoch": 2.5943759630200307,
"grad_norm": 0.8173394799232483,
"learning_rate": 6.145103757111081e-06,
"loss": 1.7583568572998047,
"memory(GiB)": 136.87,
"step": 6735,
"token_acc": 0.5889648190331561,
"train_speed(iter/s)": 0.225127
},
{
"epoch": 2.5963020030816644,
"grad_norm": 0.7020078301429749,
"learning_rate": 6.087848433359945e-06,
"loss": 1.7225908279418944,
"memory(GiB)": 136.87,
"step": 6740,
"token_acc": 0.615927123126653,
"train_speed(iter/s)": 0.225061
},
{
"epoch": 2.5982280431432976,
"grad_norm": 0.6174955368041992,
"learning_rate": 6.03084743141602e-06,
"loss": 1.7318885803222657,
"memory(GiB)": 136.87,
"step": 6745,
"token_acc": 0.6050379065786256,
"train_speed(iter/s)": 0.225017
},
{
"epoch": 2.600154083204931,
"grad_norm": 0.9957442879676819,
"learning_rate": 5.974101008255815e-06,
"loss": 1.770187759399414,
"memory(GiB)": 136.87,
"step": 6750,
"token_acc": 0.6030195381882771,
"train_speed(iter/s)": 0.224987
},
{
"epoch": 2.602080123266564,
"grad_norm": 0.6950587630271912,
"learning_rate": 5.917609419708148e-06,
"loss": 1.7540443420410157,
"memory(GiB)": 136.87,
"step": 6755,
"token_acc": 0.5961683892109907,
"train_speed(iter/s)": 0.225077
},
{
"epoch": 2.6040061633281972,
"grad_norm": 2.823882579803467,
"learning_rate": 5.86137292045294e-06,
"loss": 1.7139766693115235,
"memory(GiB)": 136.87,
"step": 6760,
"token_acc": 0.6041039671682626,
"train_speed(iter/s)": 0.225045
},
{
"epoch": 2.6059322033898304,
"grad_norm": 1.0858889818191528,
"learning_rate": 5.8053917640201184e-06,
"loss": 1.7562145233154296,
"memory(GiB)": 136.87,
"step": 6765,
"token_acc": 0.592943654555029,
"train_speed(iter/s)": 0.225026
},
{
"epoch": 2.6078582434514637,
"grad_norm": 2.0547709465026855,
"learning_rate": 5.749666202788412e-06,
"loss": 1.7477420806884765,
"memory(GiB)": 136.87,
"step": 6770,
"token_acc": 0.5923703386198028,
"train_speed(iter/s)": 0.224996
},
{
"epoch": 2.609784283513097,
"grad_norm": 1.2869744300842285,
"learning_rate": 5.694196487984325e-06,
"loss": 1.75133056640625,
"memory(GiB)": 136.87,
"step": 6775,
"token_acc": 0.5837070254110612,
"train_speed(iter/s)": 0.224937
},
{
"epoch": 2.61171032357473,
"grad_norm": 2.350369453430176,
"learning_rate": 5.638982869680863e-06,
"loss": 1.7174198150634765,
"memory(GiB)": 136.87,
"step": 6780,
"token_acc": 0.5988914084152179,
"train_speed(iter/s)": 0.224926
},
{
"epoch": 2.6136363636363638,
"grad_norm": 1.6764682531356812,
"learning_rate": 5.584025596796536e-06,
"loss": 1.7689947128295898,
"memory(GiB)": 136.87,
"step": 6785,
"token_acc": 0.5922707523439287,
"train_speed(iter/s)": 0.225015
},
{
"epoch": 2.615562403697997,
"grad_norm": 0.7412009835243225,
"learning_rate": 5.529324917094125e-06,
"loss": 1.6647150039672851,
"memory(GiB)": 136.87,
"step": 6790,
"token_acc": 0.6217391304347826,
"train_speed(iter/s)": 0.224958
},
{
"epoch": 2.61748844375963,
"grad_norm": 0.6097057461738586,
"learning_rate": 5.474881077179653e-06,
"loss": 1.7494089126586914,
"memory(GiB)": 136.87,
"step": 6795,
"token_acc": 0.6094345150893642,
"train_speed(iter/s)": 0.224907
},
{
"epoch": 2.6194144838212634,
"grad_norm": 1.9033492803573608,
"learning_rate": 5.420694322501238e-06,
"loss": 1.7284103393554688,
"memory(GiB)": 136.87,
"step": 6800,
"token_acc": 0.5902812037493833,
"train_speed(iter/s)": 0.224879
},
{
"epoch": 2.6213405238828966,
"grad_norm": 1.4216325283050537,
"learning_rate": 5.366764897347963e-06,
"loss": 1.7383384704589844,
"memory(GiB)": 136.87,
"step": 6805,
"token_acc": 0.575491426181514,
"train_speed(iter/s)": 0.224823
},
{
"epoch": 2.6232665639445303,
"grad_norm": 1.8279755115509033,
"learning_rate": 5.313093044848796e-06,
"loss": 1.7504913330078125,
"memory(GiB)": 136.87,
"step": 6810,
"token_acc": 0.6075692151384303,
"train_speed(iter/s)": 0.224855
},
{
"epoch": 2.6251926040061635,
"grad_norm": 0.6780545115470886,
"learning_rate": 5.259679006971531e-06,
"loss": 1.7905879974365235,
"memory(GiB)": 136.87,
"step": 6815,
"token_acc": 0.5929549902152642,
"train_speed(iter/s)": 0.224942
},
{
"epoch": 2.6271186440677967,
"grad_norm": 1.0205895900726318,
"learning_rate": 5.206523024521612e-06,
"loss": 1.75707950592041,
"memory(GiB)": 136.87,
"step": 6820,
"token_acc": 0.5882657017317137,
"train_speed(iter/s)": 0.224846
},
{
"epoch": 2.62904468412943,
"grad_norm": 2.8208160400390625,
"learning_rate": 5.15362533714115e-06,
"loss": 1.7804702758789062,
"memory(GiB)": 136.87,
"step": 6825,
"token_acc": 0.5790851955307262,
"train_speed(iter/s)": 0.224883
},
{
"epoch": 2.630970724191063,
"grad_norm": 0.7335540652275085,
"learning_rate": 5.100986183307732e-06,
"loss": 1.679723358154297,
"memory(GiB)": 136.87,
"step": 6830,
"token_acc": 0.6034434879200222,
"train_speed(iter/s)": 0.224802
},
{
"epoch": 2.6328967642526964,
"grad_norm": 1.5990538597106934,
"learning_rate": 5.04860580033345e-06,
"loss": 1.7369144439697266,
"memory(GiB)": 136.87,
"step": 6835,
"token_acc": 0.6018219218336762,
"train_speed(iter/s)": 0.224755
},
{
"epoch": 2.6348228043143296,
"grad_norm": 0.9568957686424255,
"learning_rate": 4.996484424363776e-06,
"loss": 1.757358932495117,
"memory(GiB)": 136.87,
"step": 6840,
"token_acc": 0.6280649926144757,
"train_speed(iter/s)": 0.224637
},
{
"epoch": 2.636748844375963,
"grad_norm": 0.7441213726997375,
"learning_rate": 4.944622290376476e-06,
"loss": 1.7873550415039063,
"memory(GiB)": 136.87,
"step": 6845,
"token_acc": 0.5898576512455516,
"train_speed(iter/s)": 0.224725
},
{
"epoch": 2.6386748844375965,
"grad_norm": 0.8088259696960449,
"learning_rate": 4.893019632180619e-06,
"loss": 1.7158393859863281,
"memory(GiB)": 136.87,
"step": 6850,
"token_acc": 0.600619933237959,
"train_speed(iter/s)": 0.224682
},
{
"epoch": 2.6406009244992297,
"grad_norm": 1.025926947593689,
"learning_rate": 4.841676682415461e-06,
"loss": 1.7305896759033204,
"memory(GiB)": 136.87,
"step": 6855,
"token_acc": 0.6054216867469879,
"train_speed(iter/s)": 0.224662
},
{
"epoch": 2.642526964560863,
"grad_norm": 0.8718918561935425,
"learning_rate": 4.790593672549408e-06,
"loss": 1.8130304336547851,
"memory(GiB)": 136.87,
"step": 6860,
"token_acc": 0.5791065611912517,
"train_speed(iter/s)": 0.224729
},
{
"epoch": 2.644453004622496,
"grad_norm": 1.4569692611694336,
"learning_rate": 4.739770832879034e-06,
"loss": 1.7960962295532226,
"memory(GiB)": 136.87,
"step": 6865,
"token_acc": 0.5908096280087527,
"train_speed(iter/s)": 0.224616
},
{
"epoch": 2.6463790446841293,
"grad_norm": 0.8462098836898804,
"learning_rate": 4.6892083925279276e-06,
"loss": 1.6946815490722655,
"memory(GiB)": 136.87,
"step": 6870,
"token_acc": 0.5945823927765237,
"train_speed(iter/s)": 0.224702
},
{
"epoch": 2.648305084745763,
"grad_norm": 0.6256276369094849,
"learning_rate": 4.638906579445774e-06,
"loss": 1.7373634338378907,
"memory(GiB)": 136.87,
"step": 6875,
"token_acc": 0.6152321630804077,
"train_speed(iter/s)": 0.224791
},
{
"epoch": 2.650231124807396,
"grad_norm": 2.569542646408081,
"learning_rate": 4.588865620407265e-06,
"loss": 1.7344160079956055,
"memory(GiB)": 136.87,
"step": 6880,
"token_acc": 0.5941598614204405,
"train_speed(iter/s)": 0.224613
},
{
"epoch": 2.6521571648690294,
"grad_norm": 0.5307633280754089,
"learning_rate": 4.53908574101107e-06,
"loss": 1.7948463439941407,
"memory(GiB)": 136.87,
"step": 6885,
"token_acc": 0.5861264319049639,
"train_speed(iter/s)": 0.2247
},
{
"epoch": 2.6540832049306626,
"grad_norm": 0.6971538662910461,
"learning_rate": 4.489567165678867e-06,
"loss": 1.7259840011596679,
"memory(GiB)": 136.87,
"step": 6890,
"token_acc": 0.5853333333333334,
"train_speed(iter/s)": 0.22459
},
{
"epoch": 2.656009244992296,
"grad_norm": 1.2193446159362793,
"learning_rate": 4.440310117654264e-06,
"loss": 1.8190689086914062,
"memory(GiB)": 136.87,
"step": 6895,
"token_acc": 0.5909868796349116,
"train_speed(iter/s)": 0.224678
},
{
"epoch": 2.657935285053929,
"grad_norm": 0.9335721731185913,
"learning_rate": 4.3913148190018875e-06,
"loss": 1.7426830291748048,
"memory(GiB)": 136.87,
"step": 6900,
"token_acc": 0.5706609349811929,
"train_speed(iter/s)": 0.224456
},
{
"epoch": 2.6598613251155623,
"grad_norm": 1.0697193145751953,
"learning_rate": 4.342581490606269e-06,
"loss": 1.6869901657104491,
"memory(GiB)": 136.87,
"step": 6905,
"token_acc": 0.5847683725442638,
"train_speed(iter/s)": 0.224543
},
{
"epoch": 2.6617873651771955,
"grad_norm": 0.8594087362289429,
"learning_rate": 4.2941103521709215e-06,
"loss": 1.7198274612426758,
"memory(GiB)": 136.87,
"step": 6910,
"token_acc": 0.5775220040622884,
"train_speed(iter/s)": 0.224632
},
{
"epoch": 2.6637134052388287,
"grad_norm": 1.301807165145874,
"learning_rate": 4.245901622217343e-06,
"loss": 1.7633750915527344,
"memory(GiB)": 136.87,
"step": 6915,
"token_acc": 0.6019881475817244,
"train_speed(iter/s)": 0.224483
},
{
"epoch": 2.6656394453004624,
"grad_norm": 0.8590920567512512,
"learning_rate": 4.19795551808403e-06,
"loss": 1.7495052337646484,
"memory(GiB)": 136.87,
"step": 6920,
"token_acc": 0.5740461306316016,
"train_speed(iter/s)": 0.224566
},
{
"epoch": 2.6675654853620956,
"grad_norm": 0.7486931085586548,
"learning_rate": 4.150272255925451e-06,
"loss": 1.7158809661865235,
"memory(GiB)": 136.87,
"step": 6925,
"token_acc": 0.6221906789685356,
"train_speed(iter/s)": 0.224421
},
{
"epoch": 2.669491525423729,
"grad_norm": 0.7119036316871643,
"learning_rate": 4.102852050711148e-06,
"loss": 1.698335838317871,
"memory(GiB)": 136.87,
"step": 6930,
"token_acc": 0.5869154463863958,
"train_speed(iter/s)": 0.224509
},
{
"epoch": 2.671417565485362,
"grad_norm": 7.528170585632324,
"learning_rate": 4.055695116224688e-06,
"loss": 1.7506807327270508,
"memory(GiB)": 136.87,
"step": 6935,
"token_acc": 0.5712212315985901,
"train_speed(iter/s)": 0.224596
},
{
"epoch": 2.6733436055469952,
"grad_norm": 0.8194499015808105,
"learning_rate": 4.008801665062789e-06,
"loss": 1.740778350830078,
"memory(GiB)": 136.87,
"step": 6940,
"token_acc": 0.5935390549662488,
"train_speed(iter/s)": 0.224484
},
{
"epoch": 2.675269645608629,
"grad_norm": 0.5649047493934631,
"learning_rate": 3.962171908634265e-06,
"loss": 1.719742202758789,
"memory(GiB)": 136.87,
"step": 6945,
"token_acc": 0.5997064374082617,
"train_speed(iter/s)": 0.22457
},
{
"epoch": 2.677195685670262,
"grad_norm": 0.6146143674850464,
"learning_rate": 3.91580605715916e-06,
"loss": 1.7335212707519532,
"memory(GiB)": 136.87,
"step": 6950,
"token_acc": 0.5846676370693837,
"train_speed(iter/s)": 0.224429
},
{
"epoch": 2.6791217257318953,
"grad_norm": 0.7810277342796326,
"learning_rate": 3.869704319667732e-06,
"loss": 1.7519798278808594,
"memory(GiB)": 136.87,
"step": 6955,
"token_acc": 0.6102680829539706,
"train_speed(iter/s)": 0.224514
},
{
"epoch": 2.6810477657935285,
"grad_norm": 1.1517738103866577,
"learning_rate": 3.823866903999537e-06,
"loss": 1.777420997619629,
"memory(GiB)": 136.87,
"step": 6960,
"token_acc": 0.6020356234096692,
"train_speed(iter/s)": 0.224339
},
{
"epoch": 2.6829738058551618,
"grad_norm": 0.8711195588111877,
"learning_rate": 3.7782940168025195e-06,
"loss": 1.7663118362426757,
"memory(GiB)": 136.87,
"step": 6965,
"token_acc": 0.5815662397648541,
"train_speed(iter/s)": 0.224425
},
{
"epoch": 2.684899845916795,
"grad_norm": 0.860407292842865,
"learning_rate": 3.732985863532039e-06,
"loss": 1.7647832870483398,
"memory(GiB)": 136.87,
"step": 6970,
"token_acc": 0.584977033234261,
"train_speed(iter/s)": 0.224511
},
{
"epoch": 2.686825885978428,
"grad_norm": 1.1411752700805664,
"learning_rate": 3.687942648449967e-06,
"loss": 1.7592964172363281,
"memory(GiB)": 136.87,
"step": 6975,
"token_acc": 0.5915955351280368,
"train_speed(iter/s)": 0.224327
},
{
"epoch": 2.6887519260400614,
"grad_norm": 0.5628349184989929,
"learning_rate": 3.643164574623763e-06,
"loss": 1.7299165725708008,
"memory(GiB)": 136.87,
"step": 6980,
"token_acc": 0.5806138306138307,
"train_speed(iter/s)": 0.224415
},
{
"epoch": 2.690677966101695,
"grad_norm": 0.6771619319915771,
"learning_rate": 3.5986518439255142e-06,
"loss": 1.7422441482543944,
"memory(GiB)": 136.87,
"step": 6985,
"token_acc": 0.5721721721721722,
"train_speed(iter/s)": 0.224209
},
{
"epoch": 2.6926040061633283,
"grad_norm": 0.6446504592895508,
"learning_rate": 3.554404657031142e-06,
"loss": 1.7097484588623046,
"memory(GiB)": 136.87,
"step": 6990,
"token_acc": 0.6016360932077343,
"train_speed(iter/s)": 0.224298
},
{
"epoch": 2.6945300462249615,
"grad_norm": 0.8920105695724487,
"learning_rate": 3.5104232134193433e-06,
"loss": 1.732600784301758,
"memory(GiB)": 136.87,
"step": 6995,
"token_acc": 0.5957716701902749,
"train_speed(iter/s)": 0.224384
},
{
"epoch": 2.6964560862865947,
"grad_norm": 1.0072287321090698,
"learning_rate": 3.466707711370837e-06,
"loss": 1.7058277130126953,
"memory(GiB)": 136.87,
"step": 7000,
"token_acc": 0.6224467384142324,
"train_speed(iter/s)": 0.224184
},
{
"epoch": 2.698382126348228,
"grad_norm": 0.6517560482025146,
"learning_rate": 3.423258347967341e-06,
"loss": 1.6760004043579102,
"memory(GiB)": 136.87,
"step": 7005,
"token_acc": 0.6097101107706812,
"train_speed(iter/s)": 0.224271
},
{
"epoch": 2.7003081664098616,
"grad_norm": 1.0025640726089478,
"learning_rate": 3.380075319090799e-06,
"loss": 1.7969295501708984,
"memory(GiB)": 136.87,
"step": 7010,
"token_acc": 0.5955242436800663,
"train_speed(iter/s)": 0.224193
},
{
"epoch": 2.702234206471495,
"grad_norm": 3.459596633911133,
"learning_rate": 3.3371588194224257e-06,
"loss": 1.7554845809936523,
"memory(GiB)": 136.87,
"step": 7015,
"token_acc": 0.6044380125422094,
"train_speed(iter/s)": 0.22428
},
{
"epoch": 2.704160246533128,
"grad_norm": 0.8395116925239563,
"learning_rate": 3.294509042441815e-06,
"loss": 1.7265501022338867,
"memory(GiB)": 136.87,
"step": 7020,
"token_acc": 0.6165236051502145,
"train_speed(iter/s)": 0.224019
},
{
"epoch": 2.7060862865947612,
"grad_norm": 0.618012011051178,
"learning_rate": 3.252126180426161e-06,
"loss": 1.7213024139404296,
"memory(GiB)": 136.87,
"step": 7025,
"token_acc": 0.590729093873748,
"train_speed(iter/s)": 0.224105
},
{
"epoch": 2.7080123266563945,
"grad_norm": 0.7261075377464294,
"learning_rate": 3.2100104244492738e-06,
"loss": 1.7258777618408203,
"memory(GiB)": 136.87,
"step": 7030,
"token_acc": 0.6226053639846744,
"train_speed(iter/s)": 0.224191
},
{
"epoch": 2.7099383667180277,
"grad_norm": 0.6725112199783325,
"learning_rate": 3.168161964380807e-06,
"loss": 1.7173175811767578,
"memory(GiB)": 136.87,
"step": 7035,
"token_acc": 0.6363865758263941,
"train_speed(iter/s)": 0.224128
},
{
"epoch": 2.711864406779661,
"grad_norm": 0.7794114351272583,
"learning_rate": 3.1265809888853594e-06,
"loss": 1.7100196838378907,
"memory(GiB)": 136.87,
"step": 7040,
"token_acc": 0.5865485979337972,
"train_speed(iter/s)": 0.224215
},
{
"epoch": 2.713790446841294,
"grad_norm": 5.177645206451416,
"learning_rate": 3.0852676854216317e-06,
"loss": 1.8419391632080078,
"memory(GiB)": 136.87,
"step": 7045,
"token_acc": 0.5716099005711868,
"train_speed(iter/s)": 0.224134
},
{
"epoch": 2.7157164869029273,
"grad_norm": 0.8293538689613342,
"learning_rate": 3.0442222402415897e-06,
"loss": 1.7724456787109375,
"memory(GiB)": 136.87,
"step": 7050,
"token_acc": 0.610102015426723,
"train_speed(iter/s)": 0.224219
},
{
"epoch": 2.717642526964561,
"grad_norm": 0.9767295122146606,
"learning_rate": 3.0034448383896226e-06,
"loss": 1.7477230072021483,
"memory(GiB)": 136.87,
"step": 7055,
"token_acc": 0.6102189781021898,
"train_speed(iter/s)": 0.224304
},
{
"epoch": 2.719568567026194,
"grad_norm": 0.8059224486351013,
"learning_rate": 2.962935663701691e-06,
"loss": 1.7339973449707031,
"memory(GiB)": 136.87,
"step": 7060,
"token_acc": 0.6022085259373395,
"train_speed(iter/s)": 0.224152
},
{
"epoch": 2.7214946070878274,
"grad_norm": 1.4882394075393677,
"learning_rate": 2.9226948988045275e-06,
"loss": 1.7846340179443358,
"memory(GiB)": 136.87,
"step": 7065,
"token_acc": 0.6094908551655956,
"train_speed(iter/s)": 0.224239
},
{
"epoch": 2.7234206471494606,
"grad_norm": 0.7999475598335266,
"learning_rate": 2.882722725114792e-06,
"loss": 1.6869220733642578,
"memory(GiB)": 136.87,
"step": 7070,
"token_acc": 0.6184476940382452,
"train_speed(iter/s)": 0.224135
},
{
"epoch": 2.725346687211094,
"grad_norm": 0.6292514801025391,
"learning_rate": 2.8430193228382375e-06,
"loss": 1.7308460235595704,
"memory(GiB)": 136.87,
"step": 7075,
"token_acc": 0.6069711538461539,
"train_speed(iter/s)": 0.224223
},
{
"epoch": 2.7272727272727275,
"grad_norm": 0.7574784755706787,
"learning_rate": 2.8035848709689753e-06,
"loss": 1.7337093353271484,
"memory(GiB)": 136.87,
"step": 7080,
"token_acc": 0.5988420181968569,
"train_speed(iter/s)": 0.224062
},
{
"epoch": 2.7291987673343607,
"grad_norm": 1.2097058296203613,
"learning_rate": 2.764419547288545e-06,
"loss": 1.7413345336914063,
"memory(GiB)": 136.87,
"step": 7085,
"token_acc": 0.5783132530120482,
"train_speed(iter/s)": 0.224147
},
{
"epoch": 2.731124807395994,
"grad_norm": 0.6221473813056946,
"learning_rate": 2.725523528365234e-06,
"loss": 1.7770225524902343,
"memory(GiB)": 136.87,
"step": 7090,
"token_acc": 0.5984698214791726,
"train_speed(iter/s)": 0.224231
},
{
"epoch": 2.733050847457627,
"grad_norm": 2.5160443782806396,
"learning_rate": 2.6868969895532184e-06,
"loss": 1.7015766143798827,
"memory(GiB)": 136.87,
"step": 7095,
"token_acc": 0.5720672769853098,
"train_speed(iter/s)": 0.224131
},
{
"epoch": 2.7349768875192604,
"grad_norm": 0.7201350927352905,
"learning_rate": 2.6485401049917425e-06,
"loss": 1.7392303466796875,
"memory(GiB)": 136.87,
"step": 7100,
"token_acc": 0.5874356333676622,
"train_speed(iter/s)": 0.224217
},
{
"epoch": 2.7369029275808936,
"grad_norm": 1.706094741821289,
"learning_rate": 2.61045304760444e-06,
"loss": 1.7409717559814453,
"memory(GiB)": 136.87,
"step": 7105,
"token_acc": 0.5839363241678727,
"train_speed(iter/s)": 0.22405
},
{
"epoch": 2.738828967642527,
"grad_norm": 1.1317148208618164,
"learning_rate": 2.572635989098418e-06,
"loss": 1.7004514694213868,
"memory(GiB)": 136.87,
"step": 7110,
"token_acc": 0.6190573770491803,
"train_speed(iter/s)": 0.224136
},
{
"epoch": 2.74075500770416,
"grad_norm": 0.7893500328063965,
"learning_rate": 2.535089099963611e-06,
"loss": 1.7729026794433593,
"memory(GiB)": 136.87,
"step": 7115,
"token_acc": 0.5918638072076056,
"train_speed(iter/s)": 0.224223
},
{
"epoch": 2.7426810477657937,
"grad_norm": 0.5801466703414917,
"learning_rate": 2.4978125494719284e-06,
"loss": 1.7224542617797851,
"memory(GiB)": 136.87,
"step": 7120,
"token_acc": 0.5969348659003831,
"train_speed(iter/s)": 0.224052
},
{
"epoch": 2.744607087827427,
"grad_norm": 0.7217654585838318,
"learning_rate": 2.460806505676497e-06,
"loss": 1.7981945037841798,
"memory(GiB)": 136.87,
"step": 7125,
"token_acc": 0.6116018845700825,
"train_speed(iter/s)": 0.224138
},
{
"epoch": 2.74653312788906,
"grad_norm": 1.0213717222213745,
"learning_rate": 2.4240711354109603e-06,
"loss": 1.7582998275756836,
"memory(GiB)": 136.87,
"step": 7130,
"token_acc": 0.5914377629299679,
"train_speed(iter/s)": 0.223996
},
{
"epoch": 2.7484591679506933,
"grad_norm": 2.3008954524993896,
"learning_rate": 2.3876066042886752e-06,
"loss": 1.7343677520751952,
"memory(GiB)": 136.87,
"step": 7135,
"token_acc": 0.5983387718777811,
"train_speed(iter/s)": 0.22408
},
{
"epoch": 2.7503852080123266,
"grad_norm": 0.7274791598320007,
"learning_rate": 2.3514130767019888e-06,
"loss": 1.6822286605834962,
"memory(GiB)": 136.87,
"step": 7140,
"token_acc": 0.6042553191489362,
"train_speed(iter/s)": 0.223894
},
{
"epoch": 2.75231124807396,
"grad_norm": 0.693932294845581,
"learning_rate": 2.3154907158214682e-06,
"loss": 1.6893333435058593,
"memory(GiB)": 136.87,
"step": 7145,
"token_acc": 0.6180094786729858,
"train_speed(iter/s)": 0.223981
},
{
"epoch": 2.7542372881355934,
"grad_norm": 1.459757924079895,
"learning_rate": 2.279839683595186e-06,
"loss": 1.700738525390625,
"memory(GiB)": 136.87,
"step": 7150,
"token_acc": 0.5805562515660235,
"train_speed(iter/s)": 0.224065
},
{
"epoch": 2.7561633281972266,
"grad_norm": 0.7023071050643921,
"learning_rate": 2.244460140748014e-06,
"loss": 1.755146598815918,
"memory(GiB)": 136.87,
"step": 7155,
"token_acc": 0.5938357610301879,
"train_speed(iter/s)": 0.223996
},
{
"epoch": 2.75808936825886,
"grad_norm": 0.7074206471443176,
"learning_rate": 2.2093522467808434e-06,
"loss": 1.7734880447387695,
"memory(GiB)": 136.87,
"step": 7160,
"token_acc": 0.5752788104089219,
"train_speed(iter/s)": 0.224081
},
{
"epoch": 2.760015408320493,
"grad_norm": 0.7820270657539368,
"learning_rate": 2.1745161599699276e-06,
"loss": 1.7644598007202148,
"memory(GiB)": 136.87,
"step": 7165,
"token_acc": 0.5852287931495852,
"train_speed(iter/s)": 0.223942
},
{
"epoch": 2.7619414483821263,
"grad_norm": 2.118448257446289,
"learning_rate": 2.139952037366104e-06,
"loss": 1.731546401977539,
"memory(GiB)": 136.87,
"step": 7170,
"token_acc": 0.5904084442404773,
"train_speed(iter/s)": 0.224025
},
{
"epoch": 2.7638674884437595,
"grad_norm": 0.6677964925765991,
"learning_rate": 2.105660034794142e-06,
"loss": 1.722255325317383,
"memory(GiB)": 136.87,
"step": 7175,
"token_acc": 0.5678412312677197,
"train_speed(iter/s)": 0.22411
},
{
"epoch": 2.7657935285053927,
"grad_norm": 0.6672474145889282,
"learning_rate": 2.0716403068520157e-06,
"loss": 1.7261585235595702,
"memory(GiB)": 136.87,
"step": 7180,
"token_acc": 0.5885957900346389,
"train_speed(iter/s)": 0.223918
},
{
"epoch": 2.767719568567026,
"grad_norm": 0.7895959615707397,
"learning_rate": 2.0378930069101935e-06,
"loss": 1.6999780654907226,
"memory(GiB)": 136.87,
"step": 7185,
"token_acc": 0.5931575506646328,
"train_speed(iter/s)": 0.224004
},
{
"epoch": 2.7696456086286596,
"grad_norm": 1.091092824935913,
"learning_rate": 2.0044182871109886e-06,
"loss": 1.7950153350830078,
"memory(GiB)": 136.87,
"step": 7190,
"token_acc": 0.6006639791320845,
"train_speed(iter/s)": 0.223937
},
{
"epoch": 2.771571648690293,
"grad_norm": 0.8204126358032227,
"learning_rate": 1.9712162983678214e-06,
"loss": 1.7184188842773438,
"memory(GiB)": 136.87,
"step": 7195,
"token_acc": 0.6253071253071253,
"train_speed(iter/s)": 0.224024
},
{
"epoch": 2.773497688751926,
"grad_norm": 0.8532833456993103,
"learning_rate": 1.9382871903645613e-06,
"loss": 1.6862924575805665,
"memory(GiB)": 136.87,
"step": 7200,
"token_acc": 0.5926946933149552,
"train_speed(iter/s)": 0.224023
},
{
"epoch": 2.7754237288135593,
"grad_norm": 0.8062304258346558,
"learning_rate": 1.9056311115548812e-06,
"loss": 1.7388378143310548,
"memory(GiB)": 136.87,
"step": 7205,
"token_acc": 0.5803533866217921,
"train_speed(iter/s)": 0.224105
},
{
"epoch": 2.7773497688751925,
"grad_norm": 0.7800110578536987,
"learning_rate": 1.8732482091615364e-06,
"loss": 1.7490245819091796,
"memory(GiB)": 136.87,
"step": 7210,
"token_acc": 0.5981247274313127,
"train_speed(iter/s)": 0.224188
},
{
"epoch": 2.779275808936826,
"grad_norm": 0.8984308242797852,
"learning_rate": 1.8411386291757385e-06,
"loss": 1.7406297683715821,
"memory(GiB)": 136.87,
"step": 7215,
"token_acc": 0.6114086146682188,
"train_speed(iter/s)": 0.224032
},
{
"epoch": 2.7812018489984593,
"grad_norm": 0.8017980456352234,
"learning_rate": 1.809302516356498e-06,
"loss": 1.713345718383789,
"memory(GiB)": 136.87,
"step": 7220,
"token_acc": 0.6096557696471098,
"train_speed(iter/s)": 0.224115
},
{
"epoch": 2.7831278890600926,
"grad_norm": 0.7595753073692322,
"learning_rate": 1.7777400142299227e-06,
"loss": 1.7871646881103516,
"memory(GiB)": 136.87,
"step": 7225,
"token_acc": 0.6052894211576846,
"train_speed(iter/s)": 0.224011
},
{
"epoch": 2.785053929121726,
"grad_norm": 1.0144189596176147,
"learning_rate": 1.7464512650886486e-06,
"loss": 1.783905601501465,
"memory(GiB)": 136.87,
"step": 7230,
"token_acc": 0.6040133779264214,
"train_speed(iter/s)": 0.224095
},
{
"epoch": 2.786979969183359,
"grad_norm": 0.6715564131736755,
"learning_rate": 1.7154364099911183e-06,
"loss": 1.7177024841308595,
"memory(GiB)": 136.87,
"step": 7235,
"token_acc": 0.5976331360946746,
"train_speed(iter/s)": 0.224181
},
{
"epoch": 2.788906009244992,
"grad_norm": 0.7995480895042419,
"learning_rate": 1.6846955887610121e-06,
"loss": 1.8080570220947265,
"memory(GiB)": 136.87,
"step": 7240,
"token_acc": 0.6073979591836735,
"train_speed(iter/s)": 0.224071
},
{
"epoch": 2.7908320493066254,
"grad_norm": 0.6984428763389587,
"learning_rate": 1.6542289399865753e-06,
"loss": 1.7685264587402343,
"memory(GiB)": 136.87,
"step": 7245,
"token_acc": 0.6078061911170929,
"train_speed(iter/s)": 0.224154
},
{
"epoch": 2.7927580893682586,
"grad_norm": 0.6516634225845337,
"learning_rate": 1.62403660102e-06,
"loss": 1.7532470703125,
"memory(GiB)": 136.87,
"step": 7250,
"token_acc": 0.5797590361445784,
"train_speed(iter/s)": 0.224032
},
{
"epoch": 2.7946841294298923,
"grad_norm": 0.7911311984062195,
"learning_rate": 1.5941187079768286e-06,
"loss": 1.6637577056884765,
"memory(GiB)": 136.87,
"step": 7255,
"token_acc": 0.6240387354030191,
"train_speed(iter/s)": 0.224115
},
{
"epoch": 2.7966101694915255,
"grad_norm": 0.7663461565971375,
"learning_rate": 1.5644753957353152e-06,
"loss": 1.7792110443115234,
"memory(GiB)": 136.87,
"step": 7260,
"token_acc": 0.5795691452397498,
"train_speed(iter/s)": 0.223977
},
{
"epoch": 2.7985362095531587,
"grad_norm": 0.7572333216667175,
"learning_rate": 1.5351067979358299e-06,
"loss": 1.7072301864624024,
"memory(GiB)": 136.87,
"step": 7265,
"token_acc": 0.5872894333843798,
"train_speed(iter/s)": 0.224061
},
{
"epoch": 2.800462249614792,
"grad_norm": 1.1427669525146484,
"learning_rate": 1.5060130469802536e-06,
"loss": 1.7319677352905274,
"memory(GiB)": 136.87,
"step": 7270,
"token_acc": 0.6005447117566954,
"train_speed(iter/s)": 0.224145
},
{
"epoch": 2.802388289676425,
"grad_norm": 0.7508957386016846,
"learning_rate": 1.4771942740313752e-06,
"loss": 1.7709579467773438,
"memory(GiB)": 136.87,
"step": 7275,
"token_acc": 0.5928060066352366,
"train_speed(iter/s)": 0.223962
},
{
"epoch": 2.8043143297380584,
"grad_norm": 1.0495327711105347,
"learning_rate": 1.4486506090123155e-06,
"loss": 1.7527055740356445,
"memory(GiB)": 136.87,
"step": 7280,
"token_acc": 0.5883588989283463,
"train_speed(iter/s)": 0.224046
},
{
"epoch": 2.806240369799692,
"grad_norm": 0.8350591063499451,
"learning_rate": 1.420382180605917e-06,
"loss": 1.7769176483154296,
"memory(GiB)": 136.87,
"step": 7285,
"token_acc": 0.5955456570155901,
"train_speed(iter/s)": 0.22392
},
{
"epoch": 2.8081664098613253,
"grad_norm": 1.2765564918518066,
"learning_rate": 1.3923891162541947e-06,
"loss": 1.752676773071289,
"memory(GiB)": 136.87,
"step": 7290,
"token_acc": 0.5978445830969937,
"train_speed(iter/s)": 0.224005
},
{
"epoch": 2.8100924499229585,
"grad_norm": 0.6112701892852783,
"learning_rate": 1.3646715421577264e-06,
"loss": 1.7212696075439453,
"memory(GiB)": 136.87,
"step": 7295,
"token_acc": 0.5964912280701754,
"train_speed(iter/s)": 0.224085
},
{
"epoch": 2.8120184899845917,
"grad_norm": 1.2070486545562744,
"learning_rate": 1.337229583275118e-06,
"loss": 1.7063007354736328,
"memory(GiB)": 136.87,
"step": 7300,
"token_acc": 0.6025467353020861,
"train_speed(iter/s)": 0.224016
},
{
"epoch": 2.813944530046225,
"grad_norm": 4.58001184463501,
"learning_rate": 1.310063363322421e-06,
"loss": 1.735680389404297,
"memory(GiB)": 136.87,
"step": 7305,
"token_acc": 0.650390625,
"train_speed(iter/s)": 0.224101
},
{
"epoch": 2.815870570107858,
"grad_norm": 0.7477810382843018,
"learning_rate": 1.2831730047725698e-06,
"loss": 1.7414691925048829,
"memory(GiB)": 136.87,
"step": 7310,
"token_acc": 0.6044548651817117,
"train_speed(iter/s)": 0.223964
},
{
"epoch": 2.8177966101694913,
"grad_norm": 1.0230112075805664,
"learning_rate": 1.2565586288548619e-06,
"loss": 1.779718780517578,
"memory(GiB)": 136.87,
"step": 7315,
"token_acc": 0.6110091743119266,
"train_speed(iter/s)": 0.224047
},
{
"epoch": 2.8197226502311246,
"grad_norm": 1.0534124374389648,
"learning_rate": 1.230220355554361e-06,
"loss": 1.7339641571044921,
"memory(GiB)": 136.87,
"step": 7320,
"token_acc": 0.6074277168494516,
"train_speed(iter/s)": 0.223899
},
{
"epoch": 2.821648690292758,
"grad_norm": 2.2908058166503906,
"learning_rate": 1.2041583036113897e-06,
"loss": 1.7959096908569336,
"memory(GiB)": 136.87,
"step": 7325,
"token_acc": 0.5788557213930349,
"train_speed(iter/s)": 0.223982
},
{
"epoch": 2.8235747303543914,
"grad_norm": 0.6651281714439392,
"learning_rate": 1.1783725905210042e-06,
"loss": 1.6699861526489257,
"memory(GiB)": 136.87,
"step": 7330,
"token_acc": 0.6325929890286326,
"train_speed(iter/s)": 0.224063
},
{
"epoch": 2.8255007704160247,
"grad_norm": 0.7531706094741821,
"learning_rate": 1.1528633325324152e-06,
"loss": 1.7188030242919923,
"memory(GiB)": 136.87,
"step": 7335,
"token_acc": 0.5931999035447312,
"train_speed(iter/s)": 0.22398
},
{
"epoch": 2.827426810477658,
"grad_norm": 0.798428475856781,
"learning_rate": 1.1276306446485265e-06,
"loss": 1.7642208099365235,
"memory(GiB)": 136.87,
"step": 7340,
"token_acc": 0.6088407005838199,
"train_speed(iter/s)": 0.224064
},
{
"epoch": 2.829352850539291,
"grad_norm": 1.0747370719909668,
"learning_rate": 1.10267464062537e-06,
"loss": 1.7407045364379883,
"memory(GiB)": 136.87,
"step": 7345,
"token_acc": 0.5861627162075592,
"train_speed(iter/s)": 0.223902
},
{
"epoch": 2.8312788906009247,
"grad_norm": 2.9889800548553467,
"learning_rate": 1.0779954329716152e-06,
"loss": 1.7443748474121095,
"memory(GiB)": 136.87,
"step": 7350,
"token_acc": 0.6030581039755352,
"train_speed(iter/s)": 0.223984
},
{
"epoch": 2.833204930662558,
"grad_norm": 0.8766227960586548,
"learning_rate": 1.0535931329480607e-06,
"loss": 1.7859058380126953,
"memory(GiB)": 136.87,
"step": 7355,
"token_acc": 0.601958814665997,
"train_speed(iter/s)": 0.224069
},
{
"epoch": 2.835130970724191,
"grad_norm": 1.2737691402435303,
"learning_rate": 1.029467850567116e-06,
"loss": 1.7284679412841797,
"memory(GiB)": 136.87,
"step": 7360,
"token_acc": 0.6073603388933015,
"train_speed(iter/s)": 0.224009
},
{
"epoch": 2.8370570107858244,
"grad_norm": 1.1878881454467773,
"learning_rate": 1.0056196945923204e-06,
"loss": 1.7716400146484375,
"memory(GiB)": 136.87,
"step": 7365,
"token_acc": 0.5788759163725224,
"train_speed(iter/s)": 0.224092
},
{
"epoch": 2.8389830508474576,
"grad_norm": 0.6760169863700867,
"learning_rate": 9.820487725378593e-07,
"loss": 1.7549810409545898,
"memory(GiB)": 136.87,
"step": 7370,
"token_acc": 0.6170703575547867,
"train_speed(iter/s)": 0.223916
},
{
"epoch": 2.840909090909091,
"grad_norm": 0.6346534490585327,
"learning_rate": 9.587551906680565e-07,
"loss": 1.776894760131836,
"memory(GiB)": 136.87,
"step": 7375,
"token_acc": 0.5744502617801047,
"train_speed(iter/s)": 0.223997
},
{
"epoch": 2.842835130970724,
"grad_norm": 0.713191568851471,
"learning_rate": 9.35739053996916e-07,
"loss": 1.745503044128418,
"memory(GiB)": 136.87,
"step": 7380,
"token_acc": 0.5749802683504341,
"train_speed(iter/s)": 0.223922
},
{
"epoch": 2.8447611710323573,
"grad_norm": 0.890779435634613,
"learning_rate": 9.130004662876445e-07,
"loss": 1.7477146148681642,
"memory(GiB)": 136.87,
"step": 7385,
"token_acc": 0.6170944087992667,
"train_speed(iter/s)": 0.224005
},
{
"epoch": 2.846687211093991,
"grad_norm": 0.5629829168319702,
"learning_rate": 8.905395300521715e-07,
"loss": 1.6916961669921875,
"memory(GiB)": 136.87,
"step": 7390,
"token_acc": 0.6348804500703235,
"train_speed(iter/s)": 0.224088
},
{
"epoch": 2.848613251155624,
"grad_norm": 2.1078343391418457,
"learning_rate": 8.683563465506985e-07,
"loss": 1.7859531402587892,
"memory(GiB)": 136.87,
"step": 7395,
"token_acc": 0.5821123988628909,
"train_speed(iter/s)": 0.223972
},
{
"epoch": 2.8505392912172574,
"grad_norm": 0.7170923352241516,
"learning_rate": 8.464510157912414e-07,
"loss": 1.7205808639526368,
"memory(GiB)": 136.87,
"step": 7400,
"token_acc": 0.5926935659760088,
"train_speed(iter/s)": 0.224053
},
{
"epoch": 2.8524653312788906,
"grad_norm": 3.9417965412139893,
"learning_rate": 8.248236365291858e-07,
"loss": 1.753695297241211,
"memory(GiB)": 136.87,
"step": 7405,
"token_acc": 0.5918211836423672,
"train_speed(iter/s)": 0.223883
},
{
"epoch": 2.854391371340524,
"grad_norm": 2.6885786056518555,
"learning_rate": 8.03474306266816e-07,
"loss": 1.7665067672729493,
"memory(GiB)": 136.87,
"step": 7410,
"token_acc": 0.5976744186046512,
"train_speed(iter/s)": 0.223965
},
{
"epoch": 2.856317411402157,
"grad_norm": 1.2264795303344727,
"learning_rate": 7.824031212528976e-07,
"loss": 1.7701858520507812,
"memory(GiB)": 136.87,
"step": 7415,
"token_acc": 0.598019801980198,
"train_speed(iter/s)": 0.224049
},
{
"epoch": 2.8582434514637907,
"grad_norm": 0.7309343814849854,
"learning_rate": 7.616101764822622e-07,
"loss": 1.7650527954101562,
"memory(GiB)": 136.87,
"step": 7420,
"token_acc": 0.6160493827160494,
"train_speed(iter/s)": 0.22392
},
{
"epoch": 2.860169491525424,
"grad_norm": 1.17842698097229,
"learning_rate": 7.410955656953211e-07,
"loss": 1.7374954223632812,
"memory(GiB)": 136.87,
"step": 7425,
"token_acc": 0.5829340634268766,
"train_speed(iter/s)": 0.224
},
{
"epoch": 2.862095531587057,
"grad_norm": 0.91789710521698,
"learning_rate": 7.208593813777045e-07,
"loss": 1.669989776611328,
"memory(GiB)": 136.87,
"step": 7430,
"token_acc": 0.6055923473142016,
"train_speed(iter/s)": 0.223858
},
{
"epoch": 2.8640215716486903,
"grad_norm": 3.0838663578033447,
"learning_rate": 7.009017147598107e-07,
"loss": 1.762928581237793,
"memory(GiB)": 136.87,
"step": 7435,
"token_acc": 0.6019141231246766,
"train_speed(iter/s)": 0.22394
},
{
"epoch": 2.8659476117103235,
"grad_norm": 0.8343214392662048,
"learning_rate": 6.812226558163895e-07,
"loss": 1.762009048461914,
"memory(GiB)": 136.87,
"step": 7440,
"token_acc": 0.6040313549832027,
"train_speed(iter/s)": 0.223836
},
{
"epoch": 2.8678736517719567,
"grad_norm": 1.6233747005462646,
"learning_rate": 6.618222932661816e-07,
"loss": 1.722498321533203,
"memory(GiB)": 136.87,
"step": 7445,
"token_acc": 0.6003214572729708,
"train_speed(iter/s)": 0.223918
},
{
"epoch": 2.86979969183359,
"grad_norm": 1.231989860534668,
"learning_rate": 6.427007145714397e-07,
"loss": 1.7752113342285156,
"memory(GiB)": 136.87,
"step": 7450,
"token_acc": 0.5910866069377441,
"train_speed(iter/s)": 0.224
},
{
"epoch": 2.871725731895223,
"grad_norm": 0.7094095349311829,
"learning_rate": 6.238580059376303e-07,
"loss": 1.7449148178100586,
"memory(GiB)": 136.87,
"step": 7455,
"token_acc": 0.5900690269427744,
"train_speed(iter/s)": 0.223867
},
{
"epoch": 2.873651771956857,
"grad_norm": 0.6649959087371826,
"learning_rate": 6.052942523129476e-07,
"loss": 1.7557939529418944,
"memory(GiB)": 136.87,
"step": 7460,
"token_acc": 0.6021354313009273,
"train_speed(iter/s)": 0.223948
},
{
"epoch": 2.87557781201849,
"grad_norm": 0.8477678298950195,
"learning_rate": 5.870095373880154e-07,
"loss": 1.7571399688720704,
"memory(GiB)": 136.87,
"step": 7465,
"token_acc": 0.6047463175122749,
"train_speed(iter/s)": 0.223831
},
{
"epoch": 2.8775038520801233,
"grad_norm": 0.7108432054519653,
"learning_rate": 5.690039435954572e-07,
"loss": 1.7514724731445312,
"memory(GiB)": 136.87,
"step": 7470,
"token_acc": 0.6071428571428571,
"train_speed(iter/s)": 0.223889
},
{
"epoch": 2.8794298921417565,
"grad_norm": 0.6702368855476379,
"learning_rate": 5.512775521095345e-07,
"loss": 1.7339820861816406,
"memory(GiB)": 136.87,
"step": 7475,
"token_acc": 0.5834730538922156,
"train_speed(iter/s)": 0.223973
},
{
"epoch": 2.8813559322033897,
"grad_norm": 1.0539880990982056,
"learning_rate": 5.338304428458007e-07,
"loss": 1.7741287231445313,
"memory(GiB)": 136.87,
"step": 7480,
"token_acc": 0.5868980689318015,
"train_speed(iter/s)": 0.223909
},
{
"epoch": 2.8832819722650234,
"grad_norm": 0.7403910160064697,
"learning_rate": 5.166626944607192e-07,
"loss": 1.770228385925293,
"memory(GiB)": 136.87,
"step": 7485,
"token_acc": 0.5823454699407282,
"train_speed(iter/s)": 0.223948
},
{
"epoch": 2.8852080123266566,
"grad_norm": 0.7450537085533142,
"learning_rate": 4.997743843513161e-07,
"loss": 1.7288265228271484,
"memory(GiB)": 136.87,
"step": 7490,
"token_acc": 0.5866099893730075,
"train_speed(iter/s)": 0.223923
},
{
"epoch": 2.88713405238829,
"grad_norm": 0.5840745568275452,
"learning_rate": 4.831655886548339e-07,
"loss": 1.7547086715698241,
"memory(GiB)": 136.87,
"step": 7495,
"token_acc": 0.5642095503013445,
"train_speed(iter/s)": 0.223907
},
{
"epoch": 2.889060092449923,
"grad_norm": 1.1622965335845947,
"learning_rate": 4.6683638224837703e-07,
"loss": 1.7875503540039062,
"memory(GiB)": 136.87,
"step": 7500,
"token_acc": 0.5763123784834737,
"train_speed(iter/s)": 0.223941
},
{
"epoch": 2.8909861325115562,
"grad_norm": 0.5760577917098999,
"learning_rate": 4.5078683874859305e-07,
"loss": 1.7808916091918945,
"memory(GiB)": 136.87,
"step": 7505,
"token_acc": 0.5878914405010438,
"train_speed(iter/s)": 0.224021
},
{
"epoch": 2.8929121725731894,
"grad_norm": 0.8660067319869995,
"learning_rate": 4.350170305113255e-07,
"loss": 1.6699819564819336,
"memory(GiB)": 136.87,
"step": 7510,
"token_acc": 0.5953842376626565,
"train_speed(iter/s)": 0.223962
},
{
"epoch": 2.8948382126348227,
"grad_norm": 0.8191347122192383,
"learning_rate": 4.195270286313016e-07,
"loss": 1.779383659362793,
"memory(GiB)": 136.87,
"step": 7515,
"token_acc": 0.5765782592454239,
"train_speed(iter/s)": 0.22397
},
{
"epoch": 2.896764252696456,
"grad_norm": 0.9169038534164429,
"learning_rate": 4.043169029417926e-07,
"loss": 1.7842195510864258,
"memory(GiB)": 136.87,
"step": 7520,
"token_acc": 0.5828894806924101,
"train_speed(iter/s)": 0.223963
},
{
"epoch": 2.898690292758089,
"grad_norm": 0.6430149674415588,
"learning_rate": 3.8938672201430103e-07,
"loss": 1.7427606582641602,
"memory(GiB)": 136.87,
"step": 7525,
"token_acc": 0.5958868894601542,
"train_speed(iter/s)": 0.223934
},
{
"epoch": 2.9006163328197228,
"grad_norm": 0.9263331294059753,
"learning_rate": 3.747365531582905e-07,
"loss": 1.7288997650146485,
"memory(GiB)": 136.87,
"step": 7530,
"token_acc": 0.5921279212792128,
"train_speed(iter/s)": 0.223882
},
{
"epoch": 2.902542372881356,
"grad_norm": 0.5870047211647034,
"learning_rate": 3.6036646242082473e-07,
"loss": 1.735024642944336,
"memory(GiB)": 136.87,
"step": 7535,
"token_acc": 0.5928615895413987,
"train_speed(iter/s)": 0.223963
},
{
"epoch": 2.904468412942989,
"grad_norm": 0.7504586577415466,
"learning_rate": 3.4627651458629673e-07,
"loss": 1.7281782150268554,
"memory(GiB)": 136.87,
"step": 7540,
"token_acc": 0.6100418410041841,
"train_speed(iter/s)": 0.223937
},
{
"epoch": 2.9063944530046224,
"grad_norm": 0.7671431303024292,
"learning_rate": 3.324667731761585e-07,
"loss": 1.700419044494629,
"memory(GiB)": 136.87,
"step": 7545,
"token_acc": 0.630580682812956,
"train_speed(iter/s)": 0.223964
},
{
"epoch": 2.9083204930662556,
"grad_norm": 0.6485986709594727,
"learning_rate": 3.1893730044858793e-07,
"loss": 1.7233165740966796,
"memory(GiB)": 136.87,
"step": 7550,
"token_acc": 0.6069044879171461,
"train_speed(iter/s)": 0.223879
},
{
"epoch": 2.9102465331278893,
"grad_norm": 1.8354309797286987,
"learning_rate": 3.0568815739825257e-07,
"loss": 1.8245319366455077,
"memory(GiB)": 136.87,
"step": 7555,
"token_acc": 0.5828267477203647,
"train_speed(iter/s)": 0.223958
},
{
"epoch": 2.9121725731895225,
"grad_norm": 1.4922711849212646,
"learning_rate": 2.927194037559977e-07,
"loss": 1.734865951538086,
"memory(GiB)": 136.87,
"step": 7560,
"token_acc": 0.5981385162879824,
"train_speed(iter/s)": 0.223795
},
{
"epoch": 2.9140986132511557,
"grad_norm": 0.8372921347618103,
"learning_rate": 2.8003109798861033e-07,
"loss": 1.674810791015625,
"memory(GiB)": 136.87,
"step": 7565,
"token_acc": 0.6110693713999499,
"train_speed(iter/s)": 0.223876
},
{
"epoch": 2.916024653312789,
"grad_norm": 0.802435040473938,
"learning_rate": 2.676232972985346e-07,
"loss": 1.730869674682617,
"memory(GiB)": 136.87,
"step": 7570,
"token_acc": 0.6064052678838671,
"train_speed(iter/s)": 0.223956
},
{
"epoch": 2.917950693374422,
"grad_norm": 0.6881040334701538,
"learning_rate": 2.554960576236082e-07,
"loss": 1.7926429748535155,
"memory(GiB)": 136.87,
"step": 7575,
"token_acc": 0.6115107913669064,
"train_speed(iter/s)": 0.223795
},
{
"epoch": 2.9198767334360554,
"grad_norm": 0.6949822902679443,
"learning_rate": 2.436494336368403e-07,
"loss": 1.7326370239257813,
"memory(GiB)": 136.87,
"step": 7580,
"token_acc": 0.5845997973657548,
"train_speed(iter/s)": 0.223877
},
{
"epoch": 2.9218027734976886,
"grad_norm": 0.7776098251342773,
"learning_rate": 2.3208347874612706e-07,
"loss": 1.7021476745605468,
"memory(GiB)": 136.87,
"step": 7585,
"token_acc": 0.6014399588583184,
"train_speed(iter/s)": 0.2238
},
{
"epoch": 2.923728813559322,
"grad_norm": 0.8195444941520691,
"learning_rate": 2.207982450940435e-07,
"loss": 1.7387762069702148,
"memory(GiB)": 136.87,
"step": 7590,
"token_acc": 0.6017857142857143,
"train_speed(iter/s)": 0.223882
},
{
"epoch": 2.9256548536209555,
"grad_norm": 2.540602445602417,
"learning_rate": 2.0979378355758666e-07,
"loss": 1.7658845901489257,
"memory(GiB)": 136.87,
"step": 7595,
"token_acc": 0.5994152046783626,
"train_speed(iter/s)": 0.223964
},
{
"epoch": 2.9275808936825887,
"grad_norm": 0.7009822130203247,
"learning_rate": 1.9907014374796057e-07,
"loss": 1.7436330795288086,
"memory(GiB)": 136.87,
"step": 7600,
"token_acc": 0.571943887775551,
"train_speed(iter/s)": 0.22387
},
{
"epoch": 2.929506933744222,
"grad_norm": 0.5691471695899963,
"learning_rate": 1.886273740103403e-07,
"loss": 1.7309642791748048,
"memory(GiB)": 136.87,
"step": 7605,
"token_acc": 0.5800542740841248,
"train_speed(iter/s)": 0.223899
},
{
"epoch": 2.931432973805855,
"grad_norm": 1.1609901189804077,
"learning_rate": 1.7846552142366385e-07,
"loss": 1.7344337463378907,
"memory(GiB)": 136.87,
"step": 7610,
"token_acc": 0.5763970300898789,
"train_speed(iter/s)": 0.223777
},
{
"epoch": 2.9333590138674883,
"grad_norm": 0.7125633955001831,
"learning_rate": 1.6858463180040308e-07,
"loss": 1.779339599609375,
"memory(GiB)": 136.87,
"step": 7615,
"token_acc": 0.6075451925596018,
"train_speed(iter/s)": 0.223759
},
{
"epoch": 2.935285053929122,
"grad_norm": 0.6668746471405029,
"learning_rate": 1.589847496863972e-07,
"loss": 1.740182113647461,
"memory(GiB)": 136.87,
"step": 7620,
"token_acc": 0.5951795376291196,
"train_speed(iter/s)": 0.22363
},
{
"epoch": 2.937211093990755,
"grad_norm": 1.28075110912323,
"learning_rate": 1.4966591836060305e-07,
"loss": 1.7689586639404298,
"memory(GiB)": 136.87,
"step": 7625,
"token_acc": 0.6207694532831936,
"train_speed(iter/s)": 0.22371
},
{
"epoch": 2.9391371340523884,
"grad_norm": 1.0082805156707764,
"learning_rate": 1.406281798349146e-07,
"loss": 1.7024627685546876,
"memory(GiB)": 136.87,
"step": 7630,
"token_acc": 0.6028976936723832,
"train_speed(iter/s)": 0.223733
},
{
"epoch": 2.9410631741140216,
"grad_norm": 1.7123711109161377,
"learning_rate": 1.318715748540103e-07,
"loss": 1.739908218383789,
"memory(GiB)": 136.87,
"step": 7635,
"token_acc": 0.5926148303812668,
"train_speed(iter/s)": 0.223633
},
{
"epoch": 2.942989214175655,
"grad_norm": 1.2881314754486084,
"learning_rate": 1.2339614289511026e-07,
"loss": 1.681553268432617,
"memory(GiB)": 136.87,
"step": 7640,
"token_acc": 0.6093630084420568,
"train_speed(iter/s)": 0.223709
},
{
"epoch": 2.944915254237288,
"grad_norm": 0.6485515832901001,
"learning_rate": 1.1520192216784437e-07,
"loss": 1.8039119720458985,
"memory(GiB)": 136.87,
"step": 7645,
"token_acc": 0.5826385483079941,
"train_speed(iter/s)": 0.223597
},
{
"epoch": 2.9468412942989213,
"grad_norm": 1.1322157382965088,
"learning_rate": 1.0728894961405805e-07,
"loss": 1.736688232421875,
"memory(GiB)": 136.87,
"step": 7650,
"token_acc": 0.6032078103207811,
"train_speed(iter/s)": 0.223675
},
{
"epoch": 2.9487673343605545,
"grad_norm": 2.102384090423584,
"learning_rate": 9.965726090765264e-08,
"loss": 1.728193473815918,
"memory(GiB)": 136.87,
"step": 7655,
"token_acc": 0.5759125784701232,
"train_speed(iter/s)": 0.223754
},
{
"epoch": 2.9506933744221877,
"grad_norm": 0.768444299697876,
"learning_rate": 9.230689045441887e-08,
"loss": 1.7391998291015625,
"memory(GiB)": 136.87,
"step": 7660,
"token_acc": 0.599123234291281,
"train_speed(iter/s)": 0.223609
},
{
"epoch": 2.9526194144838214,
"grad_norm": 1.381227731704712,
"learning_rate": 8.523787139189804e-08,
"loss": 1.6870954513549805,
"memory(GiB)": 136.87,
"step": 7665,
"token_acc": 0.587160751565762,
"train_speed(iter/s)": 0.223686
},
{
"epoch": 2.9545454545454546,
"grad_norm": 0.7364832758903503,
"learning_rate": 7.845023558920167e-08,
"loss": 1.7425212860107422,
"memory(GiB)": 136.87,
"step": 7670,
"token_acc": 0.627431906614786,
"train_speed(iter/s)": 0.223552
},
{
"epoch": 2.956471494607088,
"grad_norm": 0.6661244630813599,
"learning_rate": 7.194401364690046e-08,
"loss": 1.713069534301758,
"memory(GiB)": 136.87,
"step": 7675,
"token_acc": 0.6015793251974156,
"train_speed(iter/s)": 0.223633
},
{
"epoch": 2.958397534668721,
"grad_norm": 0.9731634259223938,
"learning_rate": 6.571923489686466e-08,
"loss": 1.7423614501953124,
"memory(GiB)": 136.87,
"step": 7680,
"token_acc": 0.5785871964679912,
"train_speed(iter/s)": 0.223555
},
{
"epoch": 2.9603235747303542,
"grad_norm": 1.269974708557129,
"learning_rate": 5.977592740214616e-08,
"loss": 1.7837532043457032,
"memory(GiB)": 136.87,
"step": 7685,
"token_acc": 0.6003172085646312,
"train_speed(iter/s)": 0.223633
},
{
"epoch": 2.962249614791988,
"grad_norm": 0.7876796126365662,
"learning_rate": 5.411411795684662e-08,
"loss": 1.7362480163574219,
"memory(GiB)": 136.87,
"step": 7690,
"token_acc": 0.5980608197443807,
"train_speed(iter/s)": 0.223713
},
{
"epoch": 2.964175654853621,
"grad_norm": 1.410186529159546,
"learning_rate": 4.873383208599258e-08,
"loss": 1.7545875549316405,
"memory(GiB)": 136.87,
"step": 7695,
"token_acc": 0.5949971894322653,
"train_speed(iter/s)": 0.223726
},
{
"epoch": 2.9661016949152543,
"grad_norm": 0.6813892722129822,
"learning_rate": 4.363509404541055e-08,
"loss": 1.733758544921875,
"memory(GiB)": 136.87,
"step": 7700,
"token_acc": 0.6202933985330074,
"train_speed(iter/s)": 0.22378
},
{
"epoch": 2.9680277349768875,
"grad_norm": 0.7678742408752441,
"learning_rate": 3.88179268216507e-08,
"loss": 1.7275629043579102,
"memory(GiB)": 136.87,
"step": 7705,
"token_acc": 0.6020005264543301,
"train_speed(iter/s)": 0.223854
},
{
"epoch": 2.9699537750385208,
"grad_norm": 0.8488406538963318,
"learning_rate": 3.428235213185499e-08,
"loss": 1.7188274383544921,
"memory(GiB)": 136.87,
"step": 7710,
"token_acc": 0.6415284062342886,
"train_speed(iter/s)": 0.223895
},
{
"epoch": 2.971879815100154,
"grad_norm": 0.6815594434738159,
"learning_rate": 3.002839042366701e-08,
"loss": 1.72490234375,
"memory(GiB)": 136.87,
"step": 7715,
"token_acc": 0.5885198323121573,
"train_speed(iter/s)": 0.223973
},
{
"epoch": 2.973805855161787,
"grad_norm": 0.7621335387229919,
"learning_rate": 2.6056060875134792e-08,
"loss": 1.7608932495117187,
"memory(GiB)": 136.87,
"step": 7720,
"token_acc": 0.6017306412247615,
"train_speed(iter/s)": 0.224053
},
{
"epoch": 2.9757318952234204,
"grad_norm": 0.8194906711578369,
"learning_rate": 2.236538139464145e-08,
"loss": 1.7605945587158203,
"memory(GiB)": 136.87,
"step": 7725,
"token_acc": 0.5853899308983218,
"train_speed(iter/s)": 0.224108
},
{
"epoch": 2.977657935285054,
"grad_norm": 0.9346332550048828,
"learning_rate": 1.895636862079414e-08,
"loss": 1.7496177673339843,
"memory(GiB)": 136.87,
"step": 7730,
"token_acc": 0.6057591623036649,
"train_speed(iter/s)": 0.224188
},
{
"epoch": 2.9795839753466873,
"grad_norm": 0.7730504274368286,
"learning_rate": 1.5829037922396315e-08,
"loss": 1.7678319931030273,
"memory(GiB)": 136.87,
"step": 7735,
"token_acc": 0.5696400625978091,
"train_speed(iter/s)": 0.224267
},
{
"epoch": 2.9815100154083205,
"grad_norm": 0.9626866579055786,
"learning_rate": 1.2983403398315886e-08,
"loss": 1.7446685791015626,
"memory(GiB)": 136.87,
"step": 7740,
"token_acc": 0.5857822558074447,
"train_speed(iter/s)": 0.224345
},
{
"epoch": 2.9834360554699537,
"grad_norm": 1.6828466653823853,
"learning_rate": 1.0419477877478266e-08,
"loss": 1.8140941619873048,
"memory(GiB)": 136.87,
"step": 7745,
"token_acc": 0.5731184988782378,
"train_speed(iter/s)": 0.224424
},
{
"epoch": 2.985362095531587,
"grad_norm": 0.8332844972610474,
"learning_rate": 8.137272918776196e-09,
"loss": 1.807952880859375,
"memory(GiB)": 136.87,
"step": 7750,
"token_acc": 0.6261818181818182,
"train_speed(iter/s)": 0.224503
},
{
"epoch": 2.9872881355932206,
"grad_norm": 0.6141830086708069,
"learning_rate": 6.136798811041955e-09,
"loss": 1.7859077453613281,
"memory(GiB)": 136.87,
"step": 7755,
"token_acc": 0.5931198102016607,
"train_speed(iter/s)": 0.224583
},
{
"epoch": 2.989214175654854,
"grad_norm": 0.8151652812957764,
"learning_rate": 4.418064572957181e-09,
"loss": 1.7269287109375,
"memory(GiB)": 136.87,
"step": 7760,
"token_acc": 0.5939366100137804,
"train_speed(iter/s)": 0.224661
},
{
"epoch": 2.991140215716487,
"grad_norm": 0.693816602230072,
"learning_rate": 2.9810779530667353e-09,
"loss": 1.7516136169433594,
"memory(GiB)": 136.87,
"step": 7765,
"token_acc": 0.5667808219178082,
"train_speed(iter/s)": 0.22474
},
{
"epoch": 2.9930662557781202,
"grad_norm": 0.689964771270752,
"learning_rate": 1.8258454297093163e-09,
"loss": 1.7669166564941405,
"memory(GiB)": 136.87,
"step": 7770,
"token_acc": 0.5735856653915845,
"train_speed(iter/s)": 0.224819
},
{
"epoch": 2.9949922958397535,
"grad_norm": 2.221112012863159,
"learning_rate": 9.523722109966437e-10,
"loss": 1.7413850784301759,
"memory(GiB)": 136.87,
"step": 7775,
"token_acc": 0.5852379953868736,
"train_speed(iter/s)": 0.224898
},
{
"epoch": 2.9969183359013867,
"grad_norm": 0.7585455775260925,
"learning_rate": 3.606622347926414e-10,
"loss": 1.786970329284668,
"memory(GiB)": 136.87,
"step": 7780,
"token_acc": 0.5913669064748202,
"train_speed(iter/s)": 0.224974
},
{
"epoch": 2.99884437596302,
"grad_norm": 0.762778639793396,
"learning_rate": 5.0718168685681684e-11,
"loss": 1.7376707077026368,
"memory(GiB)": 136.87,
"step": 7785,
"token_acc": 0.5744859420898027,
"train_speed(iter/s)": 0.225053
}
],
"logging_steps": 5,
"max_steps": 7788,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 2000,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 7.081820555673862e+18,
"train_batch_size": 4,
"trial_name": null,
"trial_params": null
}