{ "final_eval": { "eval_seen_loss": 0.011836923658847809, "eval_seen_accuracy": 0.9978864734299517, "eval_seen_f1_valid": 0.9983498349834984, "eval_seen_f1_invalid": 0.9970612930310664, "eval_seen_macro_f1": 0.9977055640072824, "eval_seen_majority_baseline": 0.6400966183574879, "eval_seen_runtime": 0.3194, "eval_seen_samples_per_second": 20735.801, "eval_seen_steps_per_second": 162.781, "epoch": 10.0, "eval_unseen_loss": 0.04228868708014488, "eval_unseen_accuracy": 0.9947161835748792, "eval_unseen_f1_valid": 0.9958808991408732, "eval_unseen_f1_invalid": 0.9926331298673964, "eval_unseen_macro_f1": 0.9942570145041347, "eval_unseen_majority_baseline": 0.6400966183574879, "eval_unseen_runtime": 0.3081, "eval_unseen_samples_per_second": 21497.784, "eval_unseen_steps_per_second": 168.763 }, "per_rule": { "seen": { "has_city": { "acc": 0.9907, "n": 648 }, "no_excess_punct": { "acc": 0.9985, "n": 647 }, "no_phone": { "acc": 1.0, "n": 471 }, "has_phone": { "acc": 1.0, "n": 524 }, "has_price": { "acc": 1.0, "n": 521 }, "no_email": { "acc": 1.0, "n": 682 }, "no_url": { "acc": 1.0, "n": 513 }, "has_date": { "acc": 0.9982, "n": 560 }, "ends_question": { "acc": 1.0, "n": 621 }, "no_latin": { "acc": 1.0, "n": 638 }, "has_number": { "acc": 1.0, "n": 511 }, "max_words_30": { "acc": 1.0, "n": 46 }, "min_words_25": { "acc": 1.0, "n": 40 }, "min_words_15": { "acc": 0.9762, "n": 42 }, "max_words_50": { "acc": 0.9767, "n": 43 }, "min_words_20": { "acc": 0.9714, "n": 35 }, "max_words_25": { "acc": 1.0, "n": 20 }, "min_words_30": { "acc": 0.9744, "n": 39 }, "max_words_40": { "acc": 0.913, "n": 23 } }, "unseen": { "has_city": { "acc": 0.9938, "n": 648 }, "no_excess_punct": { "acc": 0.9985, "n": 647 }, "no_phone": { "acc": 0.9639, "n": 471 }, "has_phone": { "acc": 1.0, "n": 524 }, "has_price": { "acc": 1.0, "n": 521 }, "no_email": { "acc": 1.0, "n": 682 }, "no_url": { "acc": 1.0, "n": 513 }, "has_date": { "acc": 0.9982, "n": 560 }, "ends_question": { "acc": 1.0, "n": 621 }, "no_latin": { "acc": 0.9969, "n": 638 }, "has_number": { "acc": 1.0, "n": 511 }, "max_words_30": { "acc": 0.9783, "n": 46 }, "min_words_25": { "acc": 1.0, "n": 40 }, "min_words_15": { "acc": 0.9762, "n": 42 }, "max_words_50": { "acc": 0.9767, "n": 43 }, "min_words_20": { "acc": 0.9429, "n": 35 }, "max_words_25": { "acc": 0.95, "n": 20 }, "min_words_30": { "acc": 0.9487, "n": 39 }, "max_words_40": { "acc": 0.913, "n": 23 } } }, "log_history": [ { "loss": 0.6704658508300781, "grad_norm": 6.961378574371338, "learning_rate": 9.800000000000001e-06, "epoch": 0.020088388911209322, "step": 50 }, { "loss": 0.6055447769165039, "grad_norm": 6.502827167510986, "learning_rate": 1.9800000000000004e-05, "epoch": 0.040176777822418644, "step": 100 }, { "loss": 0.5635388946533203, "grad_norm": 10.348727226257324, "learning_rate": 2.98e-05, "epoch": 0.060265166733627966, "step": 150 }, { "loss": 0.49288463592529297, "grad_norm": 8.155802726745605, "learning_rate": 3.9800000000000005e-05, "epoch": 0.08035355564483729, "step": 200 }, { "loss": 0.3849527359008789, "grad_norm": 7.203456878662109, "learning_rate": 4.9800000000000004e-05, "epoch": 0.1004419445560466, "step": 250 }, { "loss": 0.2943598365783691, "grad_norm": 5.37825345993042, "learning_rate": 5.9800000000000003e-05, "epoch": 0.12053033346725593, "step": 300 }, { "loss": 0.2564892578125, "grad_norm": 10.878361701965332, "learning_rate": 6.98e-05, "epoch": 0.14061872237846526, "step": 350 }, { "loss": 0.21619060516357422, "grad_norm": 9.906046867370605, "learning_rate": 7.98e-05, "epoch": 0.16070711128967458, "step": 400 }, { "loss": 0.20003364562988282, "grad_norm": 4.608164310455322, "learning_rate": 8.98e-05, "epoch": 0.1807955002008839, "step": 450 }, { "loss": 0.17786117553710937, "grad_norm": 12.025157928466797, "learning_rate": 9.98e-05, "epoch": 0.2008838891120932, "step": 500 }, { "eval_seen_loss": 0.15569795668125153, "eval_seen_accuracy": 0.9334239130434783, "eval_seen_f1_valid": 0.9492461733225918, "eval_seen_f1_invalid": 0.9032682605834613, "eval_seen_macro_f1": 0.9262572169530265, "eval_seen_majority_baseline": 0.6400966183574879, "eval_seen_runtime": 0.3266, "eval_seen_samples_per_second": 20283.255, "eval_seen_steps_per_second": 159.228, "epoch": 0.2008838891120932, "step": 500 }, { "eval_unseen_loss": 0.20032644271850586, "eval_unseen_accuracy": 0.9172705314009661, "eval_unseen_f1_valid": 0.9373571101966164, "eval_unseen_f1_invalid": 0.8782222222222221, "eval_unseen_macro_f1": 0.9077896662094193, "eval_unseen_majority_baseline": 0.6400966183574879, "eval_unseen_runtime": 0.3075, "eval_unseen_samples_per_second": 21539.634, "eval_unseen_steps_per_second": 169.091, "epoch": 0.2008838891120932, "step": 500 }, { "loss": 0.16435718536376953, "grad_norm": 2.128711462020874, "learning_rate": 9.999900412031836e-05, "epoch": 0.22097227802330252, "step": 550 }, { "loss": 0.15185343742370605, "grad_norm": 5.858470439910889, "learning_rate": 9.999593481178791e-05, "epoch": 0.24106066693451186, "step": 600 }, { "loss": 0.1407579231262207, "grad_norm": 8.060696601867676, "learning_rate": 9.999079178693804e-05, "epoch": 0.2611490558457212, "step": 650 }, { "loss": 0.13899617195129393, "grad_norm": 2.430171489715576, "learning_rate": 9.998357525908964e-05, "epoch": 0.2812374447569305, "step": 700 }, { "loss": 0.12171868324279785, "grad_norm": 6.015133857727051, "learning_rate": 9.997428552756763e-05, "epoch": 0.3013258336681398, "step": 750 }, { "loss": 0.11208045959472657, "grad_norm": 5.097869873046875, "learning_rate": 9.996292297768872e-05, "epoch": 0.32141422257934915, "step": 800 }, { "loss": 0.08406662940979004, "grad_norm": 3.9282870292663574, "learning_rate": 9.994948808074534e-05, "epoch": 0.34150261149055844, "step": 850 }, { "loss": 0.08543995857238769, "grad_norm": 1.9250595569610596, "learning_rate": 9.993398139398606e-05, "epoch": 0.3615910004017678, "step": 900 }, { "loss": 0.10277658462524414, "grad_norm": 3.51467227935791, "learning_rate": 9.991640356059261e-05, "epoch": 0.3816793893129771, "step": 950 }, { "loss": 0.08797937393188476, "grad_norm": 5.154219150543213, "learning_rate": 9.989675530965303e-05, "epoch": 0.4017677782241864, "step": 1000 }, { "eval_seen_loss": 0.07947713881731033, "eval_seen_accuracy": 0.9719202898550725, "eval_seen_f1_valid": 0.9782710280373832, "eval_seen_f1_invalid": 0.9603242320819113, "eval_seen_macro_f1": 0.9692976300596472, "eval_seen_majority_baseline": 0.6400966183574879, "eval_seen_runtime": 0.3186, "eval_seen_samples_per_second": 20791.68, "eval_seen_steps_per_second": 163.22, "epoch": 0.4017677782241864, "step": 1000 }, { "eval_unseen_loss": 0.12618499994277954, "eval_unseen_accuracy": 0.9581823671497585, "eval_unseen_f1_valid": 0.967522570055106, "eval_unseen_f1_invalid": 0.9413011231193049, "eval_unseen_macro_f1": 0.9544118465872055, "eval_unseen_majority_baseline": 0.6400966183574879, "eval_unseen_runtime": 0.2981, "eval_unseen_samples_per_second": 22222.687, "eval_unseen_steps_per_second": 174.453, "epoch": 0.4017677782241864, "step": 1000 }, { "loss": 0.07849720478057862, "grad_norm": 2.367215633392334, "learning_rate": 9.987503745613157e-05, "epoch": 0.42185616713539575, "step": 1050 }, { "loss": 0.06738131999969482, "grad_norm": 0.9078812003135681, "learning_rate": 9.985125090083481e-05, "epoch": 0.44194455604660504, "step": 1100 }, { "loss": 0.05828128814697266, "grad_norm": 3.2039096355438232, "learning_rate": 9.982539663037431e-05, "epoch": 0.4620329449578144, "step": 1150 }, { "loss": 0.07166430950164795, "grad_norm": 3.850139617919922, "learning_rate": 9.979747571712573e-05, "epoch": 0.4821213338690237, "step": 1200 }, { "loss": 0.061166787147521974, "grad_norm": 12.084016799926758, "learning_rate": 9.976748931918429e-05, "epoch": 0.502209722780233, "step": 1250 }, { "loss": 0.05616282939910889, "grad_norm": 3.185512065887451, "learning_rate": 9.973543868031676e-05, "epoch": 0.5222981116914424, "step": 1300 }, { "loss": 0.04871833324432373, "grad_norm": 3.6474103927612305, "learning_rate": 9.970132512990988e-05, "epoch": 0.5423865006026517, "step": 1350 }, { "loss": 0.04807154655456543, "grad_norm": 2.4606831073760986, "learning_rate": 9.966515008291524e-05, "epoch": 0.562474889513861, "step": 1400 }, { "loss": 0.04073795795440674, "grad_norm": 1.6424299478530884, "learning_rate": 9.962691503979052e-05, "epoch": 0.5825632784250703, "step": 1450 }, { "loss": 0.05464828491210937, "grad_norm": 0.40458548069000244, "learning_rate": 9.95866215864373e-05, "epoch": 0.6026516673362796, "step": 1500 }, { "eval_seen_loss": 0.04147813469171524, "eval_seen_accuracy": 0.9877717391304348, "eval_seen_f1_valid": 0.9904357066950054, "eval_seen_f1_invalid": 0.9830508474576272, "eval_seen_macro_f1": 0.9867432770763163, "eval_seen_majority_baseline": 0.6400966183574879, "eval_seen_runtime": 0.3165, "eval_seen_samples_per_second": 20927.195, "eval_seen_steps_per_second": 164.284, "epoch": 0.6026516673362796, "step": 1500 }, { "eval_unseen_loss": 0.08285732567310333, "eval_unseen_accuracy": 0.9770531400966184, "eval_unseen_f1_valid": 0.9819990525817148, "eval_unseen_f1_invalid": 0.9683597002497918, "eval_unseen_macro_f1": 0.9751793764157533, "eval_unseen_majority_baseline": 0.6400966183574879, "eval_unseen_runtime": 0.3155, "eval_unseen_samples_per_second": 20994.308, "eval_unseen_steps_per_second": 164.81, "epoch": 0.6026516673362796, "step": 1500 }, { "loss": 0.04056734085083008, "grad_norm": 19.595773696899414, "learning_rate": 9.954427139413534e-05, "epoch": 0.622740056247489, "step": 1550 }, { "loss": 0.039789986610412595, "grad_norm": 2.786728858947754, "learning_rate": 9.949986621947312e-05, "epoch": 0.6428284451586983, "step": 1600 }, { "loss": 0.03137856245040894, "grad_norm": 1.161686658859253, "learning_rate": 9.94534079042751e-05, "epoch": 0.6629168340699076, "step": 1650 }, { "loss": 0.0490680456161499, "grad_norm": 0.8502035140991211, "learning_rate": 9.94048983755253e-05, "epoch": 0.6830052229811169, "step": 1700 }, { "loss": 0.036091387271881104, "grad_norm": 2.027765989303589, "learning_rate": 9.93543396452873e-05, "epoch": 0.7030936118923262, "step": 1750 }, { "loss": 0.03713906049728394, "grad_norm": 1.404341697692871, "learning_rate": 9.930173381062093e-05, "epoch": 0.7231820008035356, "step": 1800 }, { "loss": 0.035144150257110596, "grad_norm": 0.33481183648109436, "learning_rate": 9.924708305349509e-05, "epoch": 0.7432703897147449, "step": 1850 }, { "loss": 0.038848557472229005, "grad_norm": 4.593264579772949, "learning_rate": 9.919038964069746e-05, "epoch": 0.7633587786259542, "step": 1900 }, { "loss": 0.03796250820159912, "grad_norm": 2.970884084701538, "learning_rate": 9.913165592374031e-05, "epoch": 0.7834471675371635, "step": 1950 }, { "loss": 0.030259652137756346, "grad_norm": 0.5110931992530823, "learning_rate": 9.907088433876308e-05, "epoch": 0.8035355564483728, "step": 2000 }, { "eval_seen_loss": 0.03181261196732521, "eval_seen_accuracy": 0.9907910628019324, "eval_seen_f1_valid": 0.9928344884294608, "eval_seen_f1_invalid": 0.9871172122492081, "eval_seen_macro_f1": 0.9899758503393344, "eval_seen_majority_baseline": 0.6400966183574879, "eval_seen_runtime": 0.3228, "eval_seen_samples_per_second": 20519.36, "eval_seen_steps_per_second": 161.082, "epoch": 0.8035355564483728, "step": 2000 }, { "eval_unseen_loss": 0.09161130338907242, "eval_unseen_accuracy": 0.9781099033816425, "eval_unseen_f1_valid": 0.9830270396816106, "eval_unseen_f1_invalid": 0.9691817215727949, "eval_unseen_macro_f1": 0.9761043806272027, "eval_unseen_majority_baseline": 0.6400966183574879, "eval_unseen_runtime": 0.3041, "eval_unseen_samples_per_second": 21783.433, "eval_unseen_steps_per_second": 171.005, "epoch": 0.8035355564483728, "step": 2000 }, { "loss": 0.027805449962615966, "grad_norm": 0.061120375990867615, "learning_rate": 9.900807740643124e-05, "epoch": 0.8236239453595822, "step": 2050 }, { "loss": 0.03178966760635376, "grad_norm": 0.05971622094511986, "learning_rate": 9.894323773183181e-05, "epoch": 0.8437123342707915, "step": 2100 }, { "loss": 0.03385076999664307, "grad_norm": 0.3821258544921875, "learning_rate": 9.887636800436526e-05, "epoch": 0.8638007231820009, "step": 2150 }, { "loss": 0.03567046165466309, "grad_norm": 0.27875784039497375, "learning_rate": 9.880747099763402e-05, "epoch": 0.8838891120932101, "step": 2200 }, { "loss": 0.026896452903747557, "grad_norm": 0.13735617697238922, "learning_rate": 9.873654956932737e-05, "epoch": 0.9039775010044194, "step": 2250 }, { "loss": 0.0216548752784729, "grad_norm": 0.14634734392166138, "learning_rate": 9.866360666110293e-05, "epoch": 0.9240658899156288, "step": 2300 }, { "loss": 0.028975086212158205, "grad_norm": 7.620655059814453, "learning_rate": 9.858864529846467e-05, "epoch": 0.9441542788268381, "step": 2350 }, { "loss": 0.030748412609100342, "grad_norm": 2.8802390098571777, "learning_rate": 9.851166859063744e-05, "epoch": 0.9642426677380475, "step": 2400 }, { "loss": 0.026972088813781738, "grad_norm": 5.01859188079834, "learning_rate": 9.843267973043787e-05, "epoch": 0.9843310566492567, "step": 2450 }, { "loss": 0.025179855823516846, "grad_norm": 0.2297878861427307, "learning_rate": 9.835168199414214e-05, "epoch": 1.004419445560466, "step": 2500 }, { "eval_seen_loss": 0.023833297193050385, "eval_seen_accuracy": 0.9944142512077294, "eval_seen_f1_valid": 0.9956414183060431, "eval_seen_f1_invalid": 0.9922252574070183, "eval_seen_macro_f1": 0.9939333378565307, "eval_seen_majority_baseline": 0.6400966183574879, "eval_seen_runtime": 0.3285, "eval_seen_samples_per_second": 20167.338, "eval_seen_steps_per_second": 158.318, "epoch": 1.004419445560466, "step": 2500 }, { "eval_unseen_loss": 0.06532388180494308, "eval_unseen_accuracy": 0.9844504830917874, "eval_unseen_f1_valid": 0.9878695088917677, "eval_unseen_f1_invalid": 0.978347698129073, "eval_unseen_macro_f1": 0.9831086035104204, "eval_unseen_majority_baseline": 0.6400966183574879, "eval_unseen_runtime": 0.3064, "eval_unseen_samples_per_second": 21618.559, "eval_unseen_steps_per_second": 169.711, "epoch": 1.004419445560466, "step": 2500 }, { "loss": 0.025775249004364013, "grad_norm": 1.0400502681732178, "learning_rate": 9.826867874134995e-05, "epoch": 1.0245078344716754, "step": 2550 }, { "loss": 0.0226438307762146, "grad_norm": 1.6363939046859741, "learning_rate": 9.81836734148452e-05, "epoch": 1.0445962233828847, "step": 2600 }, { "loss": 0.01809248685836792, "grad_norm": 0.01623135432600975, "learning_rate": 9.809666954045322e-05, "epoch": 1.064684612294094, "step": 2650 }, { "loss": 0.021049981117248536, "grad_norm": 0.021346036344766617, "learning_rate": 9.800767072689449e-05, "epoch": 1.0847730012053034, "step": 2700 }, { "loss": 0.026336238384246827, "grad_norm": 0.03480149060487747, "learning_rate": 9.791668066563497e-05, "epoch": 1.1048613901165127, "step": 2750 }, { "loss": 0.01243409514427185, "grad_norm": 0.07298510521650314, "learning_rate": 9.782370313073301e-05, "epoch": 1.1249497790277219, "step": 2800 }, { "loss": 0.015609384775161743, "grad_norm": 0.09682580828666687, "learning_rate": 9.77287419786828e-05, "epoch": 1.1450381679389312, "step": 2850 }, { "loss": 0.015297083854675294, "grad_norm": 0.5698757767677307, "learning_rate": 9.763180114825439e-05, "epoch": 1.1651265568501405, "step": 2900 }, { "loss": 0.00734399139881134, "grad_norm": 0.009613298811018467, "learning_rate": 9.753288466033033e-05, "epoch": 1.18521494576135, "step": 2950 }, { "loss": 0.025555052757263184, "grad_norm": 0.05337614193558693, "learning_rate": 9.743199661773888e-05, "epoch": 1.2053033346725592, "step": 3000 }, { "eval_seen_loss": 0.03496118634939194, "eval_seen_accuracy": 0.9909420289855072, "eval_seen_f1_valid": 0.9929295309922225, "eval_seen_f1_invalid": 0.9874002519949601, "eval_seen_macro_f1": 0.9901648914935912, "eval_seen_majority_baseline": 0.6400966183574879, "eval_seen_runtime": 0.3128, "eval_seen_samples_per_second": 21174.99, "eval_seen_steps_per_second": 166.229, "epoch": 1.2053033346725592, "step": 3000 }, { "eval_unseen_loss": 0.0712013989686966, "eval_unseen_accuracy": 0.9849033816425121, "eval_unseen_f1_valid": 0.9882103277528884, "eval_unseen_f1_invalid": 0.9790180444817457, "eval_unseen_macro_f1": 0.9836141861173171, "eval_unseen_majority_baseline": 0.6400966183574879, "eval_unseen_runtime": 0.3131, "eval_unseen_samples_per_second": 21157.43, "eval_unseen_steps_per_second": 166.091, "epoch": 1.2053033346725592, "step": 3000 }, { "loss": 0.027643091678619384, "grad_norm": 2.102973222732544, "learning_rate": 9.732914120508388e-05, "epoch": 1.2253917235837686, "step": 3050 }, { "loss": 0.024755525588989257, "grad_norm": 0.04891473799943924, "learning_rate": 9.722432268857117e-05, "epoch": 1.245480112494978, "step": 3100 }, { "loss": 0.026731245517730713, "grad_norm": 0.1450469195842743, "learning_rate": 9.711754541583158e-05, "epoch": 1.2655685014061873, "step": 3150 }, { "loss": 0.019302159547805786, "grad_norm": 0.19893020391464233, "learning_rate": 9.700881381574063e-05, "epoch": 1.2856568903173966, "step": 3200 }, { "loss": 0.02171895742416382, "grad_norm": 0.031684305518865585, "learning_rate": 9.689813239823489e-05, "epoch": 1.305745279228606, "step": 3250 }, { "loss": 0.018455970287322997, "grad_norm": 0.09408152848482132, "learning_rate": 9.678550575412486e-05, "epoch": 1.3258336681398153, "step": 3300 }, { "loss": 0.025521416664123536, "grad_norm": 0.09570422768592834, "learning_rate": 9.667093855490452e-05, "epoch": 1.3459220570510246, "step": 3350 }, { "loss": 0.02281453847885132, "grad_norm": 0.3635101914405823, "learning_rate": 9.655443555255764e-05, "epoch": 1.3660104459622338, "step": 3400 }, { "loss": 0.010848090648651124, "grad_norm": 0.2485629916191101, "learning_rate": 9.643600157936066e-05, "epoch": 1.386098834873443, "step": 3450 }, { "loss": 0.016650997400283814, "grad_norm": 0.9609498977661133, "learning_rate": 9.631564154768222e-05, "epoch": 1.4061872237846524, "step": 3500 }, { "eval_seen_loss": 0.017499525099992752, "eval_seen_accuracy": 0.9954710144927537, "eval_seen_f1_valid": 0.9964639321074964, "eval_seen_f1_invalid": 0.9937027707808564, "eval_seen_macro_f1": 0.9950833514441764, "eval_seen_majority_baseline": 0.6400966183574879, "eval_seen_runtime": 0.3159, "eval_seen_samples_per_second": 20968.449, "eval_seen_steps_per_second": 164.607, "epoch": 1.4061872237846524, "step": 3500 }, { "eval_unseen_loss": 0.028747964650392532, "eval_unseen_accuracy": 0.9919987922705314, "eval_unseen_f1_valid": 0.9937625044133225, "eval_unseen_f1_invalid": 0.9888444537992003, "eval_unseen_macro_f1": 0.9913034791062614, "eval_unseen_majority_baseline": 0.6400966183574879, "eval_unseen_runtime": 0.2935, "eval_unseen_samples_per_second": 22566.909, "eval_unseen_steps_per_second": 177.156, "epoch": 1.4061872237846524, "step": 3500 }, { "loss": 0.017104147672653197, "grad_norm": 0.3069566786289215, "learning_rate": 9.619336044977947e-05, "epoch": 1.4262756126958618, "step": 3550 }, { "loss": 0.013962976932525635, "grad_norm": 0.15175199508666992, "learning_rate": 9.606916335759091e-05, "epoch": 1.4463640016070711, "step": 3600 }, { "loss": 0.023543903827667235, "grad_norm": 0.09805657714605331, "learning_rate": 9.594305542252615e-05, "epoch": 1.4664523905182805, "step": 3650 }, { "loss": 0.01416290044784546, "grad_norm": 3.126929759979248, "learning_rate": 9.581504187525208e-05, "epoch": 1.4865407794294898, "step": 3700 }, { "loss": 0.01324806809425354, "grad_norm": 0.7419432401657104, "learning_rate": 9.568512802547605e-05, "epoch": 1.506629168340699, "step": 3750 }, { "loss": 0.019409667253494262, "grad_norm": 0.042299091815948486, "learning_rate": 9.555331926172559e-05, "epoch": 1.5267175572519083, "step": 3800 }, { "loss": 0.023891074657440184, "grad_norm": 0.44470810890197754, "learning_rate": 9.541962105112488e-05, "epoch": 1.5468059461631176, "step": 3850 }, { "loss": 0.011780786514282226, "grad_norm": 3.8765432834625244, "learning_rate": 9.528403893916802e-05, "epoch": 1.566894335074327, "step": 3900 }, { "loss": 0.016372852325439453, "grad_norm": 0.03911309689283371, "learning_rate": 9.514657854948898e-05, "epoch": 1.5869827239855363, "step": 3950 }, { "loss": 0.010347286462783814, "grad_norm": 1.1136096715927124, "learning_rate": 9.500724558362839e-05, "epoch": 1.6070711128967456, "step": 4000 }, { "eval_seen_loss": 0.016062559559941292, "eval_seen_accuracy": 0.9950181159420289, "eval_seen_f1_valid": 0.9961034360609281, "eval_seen_f1_invalid": 0.9930947897049591, "eval_seen_macro_f1": 0.9945991128829437, "eval_seen_majority_baseline": 0.6400966183574879, "eval_seen_runtime": 0.3221, "eval_seen_samples_per_second": 20567.513, "eval_seen_steps_per_second": 161.46, "epoch": 1.6070711128967456, "step": 4000 }, { "eval_unseen_loss": 0.07382287085056305, "eval_unseen_accuracy": 0.9827898550724637, "eval_unseen_f1_valid": 0.9864672364672364, "eval_unseen_f1_invalid": 0.97636815920398, "eval_unseen_macro_f1": 0.9814176978356082, "eval_unseen_majority_baseline": 0.6400966183574879, "eval_unseen_runtime": 0.3163, "eval_unseen_samples_per_second": 20943.475, "eval_unseen_steps_per_second": 164.411, "epoch": 1.6070711128967456, "step": 4000 }, { "loss": 0.03152747869491577, "grad_norm": 0.06820331513881683, "learning_rate": 9.486604582079704e-05, "epoch": 1.627159501807955, "step": 4050 }, { "loss": 0.015730949640274047, "grad_norm": 0.02219122089445591, "learning_rate": 9.472298511763613e-05, "epoch": 1.6472478907191643, "step": 4100 }, { "loss": 0.014006189107894897, "grad_norm": 4.819547176361084, "learning_rate": 9.457806940797439e-05, "epoch": 1.6673362796303737, "step": 4150 }, { "loss": 0.01701338529586792, "grad_norm": 0.02137128822505474, "learning_rate": 9.443130470258198e-05, "epoch": 1.687424668541583, "step": 4200 }, { "loss": 0.015609605312347412, "grad_norm": 0.14972175657749176, "learning_rate": 9.428269708892112e-05, "epoch": 1.7075130574527924, "step": 4250 }, { "loss": 0.009463921189308167, "grad_norm": 0.024293815717101097, "learning_rate": 9.413225273089364e-05, "epoch": 1.7276014463640017, "step": 4300 }, { "loss": 0.017783876657485962, "grad_norm": 1.126176118850708, "learning_rate": 9.397997786858526e-05, "epoch": 1.747689835275211, "step": 4350 }, { "loss": 0.017371171712875368, "grad_norm": 1.4426050186157227, "learning_rate": 9.382587881800687e-05, "epoch": 1.7677782241864204, "step": 4400 }, { "loss": 0.013080412149429321, "grad_norm": 0.010198249481618404, "learning_rate": 9.366996197083245e-05, "epoch": 1.7878666130976297, "step": 4450 }, { "loss": 0.010468505620956421, "grad_norm": 0.4493156671524048, "learning_rate": 9.351223379413398e-05, "epoch": 1.8079550020088389, "step": 4500 }, { "eval_seen_loss": 0.018062112852931023, "eval_seen_accuracy": 0.9950181159420289, "eval_seen_f1_valid": 0.9961071133655774, "eval_seen_f1_invalid": 0.9930832110668623, "eval_seen_macro_f1": 0.9945951622162199, "eval_seen_majority_baseline": 0.6400966183574879, "eval_seen_runtime": 0.3141, "eval_seen_samples_per_second": 21087.559, "eval_seen_steps_per_second": 165.542, "epoch": 1.8079550020088389, "step": 4500 }, { "eval_unseen_loss": 0.051321063190698624, "eval_unseen_accuracy": 0.9892814009661836, "eval_unseen_f1_valid": 0.9916026020106447, "eval_unseen_f1_invalid": 0.985186730648863, "eval_unseen_macro_f1": 0.9883946663297538, "eval_unseen_majority_baseline": 0.6400966183574879, "eval_unseen_runtime": 0.3119, "eval_unseen_samples_per_second": 21237.112, "eval_unseen_steps_per_second": 166.716, "epoch": 1.8079550020088389, "step": 4500 }, { "loss": 0.009371167421340943, "grad_norm": 0.23130910098552704, "learning_rate": 9.335270083011327e-05, "epoch": 1.8280433909200482, "step": 4550 }, { "loss": 0.00927388072013855, "grad_norm": 0.04569007828831673, "learning_rate": 9.319136969583053e-05, "epoch": 1.8481317798312575, "step": 4600 }, { "loss": 0.018707298040390015, "grad_norm": 1.7949227094650269, "learning_rate": 9.302824708292994e-05, "epoch": 1.8682201687424669, "step": 4650 }, { "loss": 0.010992642641067505, "grad_norm": 0.02038896456360817, "learning_rate": 9.286333975736206e-05, "epoch": 1.8883085576536762, "step": 4700 }, { "loss": 0.016763041019439696, "grad_norm": 36.40946578979492, "learning_rate": 9.269665455910328e-05, "epoch": 1.9083969465648853, "step": 4750 }, { "loss": 0.013855984210968017, "grad_norm": 0.3852629065513611, "learning_rate": 9.252819840187203e-05, "epoch": 1.9284853354760947, "step": 4800 }, { "loss": 0.008902734518051148, "grad_norm": 0.015681391581892967, "learning_rate": 9.235797827284202e-05, "epoch": 1.948573724387304, "step": 4850 }, { "loss": 0.008782572746276855, "grad_norm": 0.1879400908946991, "learning_rate": 9.218600123235248e-05, "epoch": 1.9686621132985134, "step": 4900 }, { "loss": 0.020532915592193602, "grad_norm": 0.6522228121757507, "learning_rate": 9.201227441361526e-05, "epoch": 1.9887505022097227, "step": 4950 }, { "loss": 0.019961978197097777, "grad_norm": 0.8586557507514954, "learning_rate": 9.183680502241903e-05, "epoch": 2.008838891120932, "step": 5000 }, { "eval_seen_loss": 0.021278277039527893, "eval_seen_accuracy": 0.9948671497584541, "eval_seen_f1_valid": 0.9959962317475272, "eval_seen_f1_invalid": 0.9928511354079058, "eval_seen_macro_f1": 0.9944236835777165, "eval_seen_majority_baseline": 0.6400966183574879, "eval_seen_runtime": 0.3206, "eval_seen_samples_per_second": 20661.243, "eval_seen_steps_per_second": 162.196, "epoch": 2.008838891120932, "step": 5000 }, { "eval_unseen_loss": 0.09243584424257278, "eval_unseen_accuracy": 0.9835446859903382, "eval_unseen_f1_valid": 0.9871930442956174, "eval_unseen_f1_invalid": 0.9769896559003589, "eval_unseen_macro_f1": 0.9820913500979882, "eval_unseen_majority_baseline": 0.6400966183574879, "eval_unseen_runtime": 0.3179, "eval_unseen_samples_per_second": 20837.542, "eval_unseen_steps_per_second": 163.58, "epoch": 2.008838891120932, "step": 5000 }, { "loss": 0.014057793617248536, "grad_norm": 0.0803026631474495, "learning_rate": 9.165960033683031e-05, "epoch": 2.0289272800321414, "step": 5050 }, { "loss": 0.01633061408996582, "grad_norm": 0.020075250416994095, "learning_rate": 9.148066770689166e-05, "epoch": 2.0490156689433507, "step": 5100 }, { "loss": 0.006894637346267701, "grad_norm": 0.011754917912185192, "learning_rate": 9.130001455431676e-05, "epoch": 2.06910405785456, "step": 5150 }, { "loss": 0.01216249942779541, "grad_norm": 0.0178280808031559, "learning_rate": 9.111764837218267e-05, "epoch": 2.0891924467657694, "step": 5200 }, { "loss": 0.013817080259323121, "grad_norm": 0.03707554191350937, "learning_rate": 9.093357672461894e-05, "epoch": 2.1092808356769788, "step": 5250 }, { "loss": 0.004771507978439331, "grad_norm": 0.30397188663482666, "learning_rate": 9.07478072464939e-05, "epoch": 2.129369224588188, "step": 5300 }, { "loss": 0.006007364988327026, "grad_norm": 0.031365204602479935, "learning_rate": 9.056034764309797e-05, "epoch": 2.1494576134993975, "step": 5350 }, { "loss": 0.00949288547039032, "grad_norm": 0.02746967040002346, "learning_rate": 9.037120568982412e-05, "epoch": 2.169546002410607, "step": 5400 }, { "loss": 0.01284904956817627, "grad_norm": 0.2411639392375946, "learning_rate": 9.018038923184529e-05, "epoch": 2.189634391321816, "step": 5450 }, { "loss": 0.00634078323841095, "grad_norm": 0.06414932012557983, "learning_rate": 8.998790618378901e-05, "epoch": 2.2097227802330255, "step": 5500 }, { "eval_seen_loss": 0.010500301606953144, "eval_seen_accuracy": 0.9977355072463768, "eval_seen_f1_valid": 0.9982321744254568, "eval_seen_f1_invalid": 0.9968507243334034, "eval_seen_macro_f1": 0.9975414493794301, "eval_seen_majority_baseline": 0.6400966183574879, "eval_seen_runtime": 0.3278, "eval_seen_samples_per_second": 20206.163, "eval_seen_steps_per_second": 158.623, "epoch": 2.2097227802330255, "step": 5500 }, { "eval_unseen_loss": 0.0262172669172287, "eval_unseen_accuracy": 0.9923007246376812, "eval_unseen_f1_valid": 0.9940007057993177, "eval_unseen_f1_invalid": 0.9892563724457551, "eval_unseen_macro_f1": 0.9916285391225363, "eval_unseen_majority_baseline": 0.6400966183574879, "eval_unseen_runtime": 0.297, "eval_unseen_samples_per_second": 22302.588, "eval_unseen_steps_per_second": 175.081, "epoch": 2.2097227802330255, "step": 5500 }, { "loss": 0.012844257354736328, "grad_norm": 0.03905527666211128, "learning_rate": 8.979376452940917e-05, "epoch": 2.229811169144235, "step": 5550 }, { "loss": 0.008379681706428528, "grad_norm": 0.00931452214717865, "learning_rate": 8.959797232125479e-05, "epoch": 2.2498995580554437, "step": 5600 }, { "loss": 0.009271252155303954, "grad_norm": 2.55387020111084, "learning_rate": 8.940053768033609e-05, "epoch": 2.269987946966653, "step": 5650 }, { "loss": 0.015088608264923095, "grad_norm": 0.033489350229501724, "learning_rate": 8.920146879578765e-05, "epoch": 2.2900763358778624, "step": 5700 }, { "loss": 0.007871510982513428, "grad_norm": 0.021451091393828392, "learning_rate": 8.900077392452864e-05, "epoch": 2.3101647247890718, "step": 5750 }, { "loss": 0.0116357684135437, "grad_norm": 1.7073649168014526, "learning_rate": 8.879846139092045e-05, "epoch": 2.330253113700281, "step": 5800 }, { "loss": 0.010076509714126587, "grad_norm": 0.07575485110282898, "learning_rate": 8.859453958642143e-05, "epoch": 2.3503415026114904, "step": 5850 }, { "loss": 0.008153905868530273, "grad_norm": 0.03403827175498009, "learning_rate": 8.838901696923871e-05, "epoch": 2.3704298915227, "step": 5900 }, { "loss": 0.002156134098768234, "grad_norm": 0.05620236694812775, "learning_rate": 8.818190206397749e-05, "epoch": 2.390518280433909, "step": 5950 }, { "loss": 0.013041321039199829, "grad_norm": 0.019352883100509644, "learning_rate": 8.797320346128739e-05, "epoch": 2.4106066693451185, "step": 6000 }, { "eval_seen_loss": 0.01673523522913456, "eval_seen_accuracy": 0.9953200483091788, "eval_seen_f1_valid": 0.9963395914511749, "eval_seen_f1_invalid": 0.993513287298598, "eval_seen_macro_f1": 0.9949264393748865, "eval_seen_majority_baseline": 0.6400966183574879, "eval_seen_runtime": 0.3192, "eval_seen_samples_per_second": 20749.181, "eval_seen_steps_per_second": 162.886, "epoch": 2.4106066693451185, "step": 6000 }, { "eval_unseen_loss": 0.06512533873319626, "eval_unseen_accuracy": 0.9859601449275363, "eval_unseen_f1_valid": 0.98898756660746, "eval_unseen_f1_invalid": 0.9806371018113679, "eval_unseen_macro_f1": 0.9848123342094139, "eval_unseen_majority_baseline": 0.6400966183574879, "eval_unseen_runtime": 0.3039, "eval_unseen_samples_per_second": 21795.481, "eval_unseen_steps_per_second": 171.1, "epoch": 2.4106066693451185, "step": 6000 }, { "loss": 0.011934045553207397, "grad_norm": 3.0569326877593994, "learning_rate": 8.776292981750618e-05, "epoch": 2.430695058256328, "step": 6050 }, { "loss": 0.009842355251312256, "grad_norm": 0.011145714670419693, "learning_rate": 8.755108985430068e-05, "epoch": 2.450783447167537, "step": 6100 }, { "loss": 0.006759999990463257, "grad_norm": 0.12077642232179642, "learning_rate": 8.73376923583051e-05, "epoch": 2.4708718360787465, "step": 6150 }, { "loss": 0.014839231967926025, "grad_norm": 0.04140232875943184, "learning_rate": 8.712274618075641e-05, "epoch": 2.490960224989956, "step": 6200 }, { "loss": 0.016083663702011107, "grad_norm": 0.03823714703321457, "learning_rate": 8.690626023712743e-05, "epoch": 2.511048613901165, "step": 6250 }, { "loss": 0.011055660247802735, "grad_norm": 6.6721906661987305, "learning_rate": 8.668824350675691e-05, "epoch": 2.5311370028123745, "step": 6300 }, { "loss": 0.01400442361831665, "grad_norm": 25.896717071533203, "learning_rate": 8.646870503247709e-05, "epoch": 2.551225391723584, "step": 6350 }, { "loss": 0.009680263996124268, "grad_norm": 0.026539063081145287, "learning_rate": 8.624765392023864e-05, "epoch": 2.571313780634793, "step": 6400 }, { "loss": 0.011566929817199707, "grad_norm": 0.14755235612392426, "learning_rate": 8.602509933873302e-05, "epoch": 2.5914021695460026, "step": 6450 }, { "loss": 0.008653899431228637, "grad_norm": 0.025059988722205162, "learning_rate": 8.580105051901206e-05, "epoch": 2.611490558457212, "step": 6500 }, { "eval_seen_loss": 0.014686978422105312, "eval_seen_accuracy": 0.996225845410628, "eval_seen_f1_valid": 0.9970515390965916, "eval_seen_f1_invalid": 0.9947578108618159, "eval_seen_macro_f1": 0.9959046749792038, "eval_seen_majority_baseline": 0.6400966183574879, "eval_seen_runtime": 0.3206, "eval_seen_samples_per_second": 20658.477, "eval_seen_steps_per_second": 162.174, "epoch": 2.611490558457212, "step": 6500 }, { "eval_unseen_loss": 0.040618833154439926, "eval_unseen_accuracy": 0.9883756038647343, "eval_unseen_f1_valid": 0.9909379781099212, "eval_unseen_f1_invalid": 0.983792885708272, "eval_unseen_macro_f1": 0.9873654319090965, "eval_unseen_majority_baseline": 0.6400966183574879, "eval_unseen_runtime": 0.3276, "eval_unseen_samples_per_second": 20220.354, "eval_unseen_steps_per_second": 158.735, "epoch": 2.611490558457212, "step": 6500 }, { "loss": 0.017121171951293944, "grad_norm": 1.6399306058883667, "learning_rate": 8.557551675410521e-05, "epoch": 2.6315789473684212, "step": 6550 }, { "loss": 0.01153093457221985, "grad_norm": 0.0197468101978302, "learning_rate": 8.534850739863402e-05, "epoch": 2.6516673362796306, "step": 6600 }, { "loss": 0.005534862875938415, "grad_norm": 0.011156822554767132, "learning_rate": 8.512003186842414e-05, "epoch": 2.67175572519084, "step": 6650 }, { "loss": 0.0065694618225097656, "grad_norm": 0.007382044102996588, "learning_rate": 8.489009964011476e-05, "epoch": 2.6918441141020493, "step": 6700 }, { "loss": 0.004922803938388825, "grad_norm": 0.023747533559799194, "learning_rate": 8.465872025076557e-05, "epoch": 2.7119325030132586, "step": 6750 }, { "loss": 0.004972059428691864, "grad_norm": 0.1991339474916458, "learning_rate": 8.442590329746114e-05, "epoch": 2.7320208919244675, "step": 6800 }, { "loss": 0.00948186993598938, "grad_norm": 0.018709462136030197, "learning_rate": 8.419165843691292e-05, "epoch": 2.752109280835677, "step": 6850 }, { "loss": 0.017984031438827514, "grad_norm": 0.04365852475166321, "learning_rate": 8.395599538505867e-05, "epoch": 2.772197669746886, "step": 6900 }, { "loss": 0.010866541862487793, "grad_norm": 3.3207244873046875, "learning_rate": 8.371892391665942e-05, "epoch": 2.7922860586580955, "step": 6950 }, { "loss": 0.004931770861148834, "grad_norm": 0.013545851223170757, "learning_rate": 8.348045386489412e-05, "epoch": 2.812374447569305, "step": 7000 }, { "eval_seen_loss": 0.016195246949791908, "eval_seen_accuracy": 0.9965277777777778, "eval_seen_f1_valid": 0.997288695037133, "eval_seen_f1_invalid": 0.9951731374606506, "eval_seen_macro_f1": 0.9962309162488918, "eval_seen_majority_baseline": 0.6400966183574879, "eval_seen_runtime": 0.3305, "eval_seen_samples_per_second": 20041.803, "eval_seen_steps_per_second": 157.333, "epoch": 2.812374447569305, "step": 7000 }, { "eval_unseen_loss": 0.034073229879140854, "eval_unseen_accuracy": 0.9930555555555556, "eval_unseen_f1_valid": 0.9945639328763886, "eval_unseen_f1_invalid": 0.9903886335144171, "eval_unseen_macro_f1": 0.9924762831954028, "eval_unseen_majority_baseline": 0.6400966183574879, "eval_unseen_runtime": 0.2931, "eval_unseen_samples_per_second": 22603.169, "eval_unseen_steps_per_second": 177.44, "epoch": 2.812374447569305, "step": 7000 }, { "loss": 0.016864250898361206, "grad_norm": 0.03497542813420296, "learning_rate": 8.32405951209517e-05, "epoch": 2.8324628364805142, "step": 7050 }, { "loss": 0.011661477088928222, "grad_norm": 0.1768326759338379, "learning_rate": 8.29993576336209e-05, "epoch": 2.8525512253917236, "step": 7100 }, { "loss": 0.00856854796409607, "grad_norm": 0.01989070326089859, "learning_rate": 8.275675140887748e-05, "epoch": 2.872639614302933, "step": 7150 }, { "loss": 0.005270370841026306, "grad_norm": 2.518010377883911, "learning_rate": 8.251278650946938e-05, "epoch": 2.8927280032141423, "step": 7200 }, { "loss": 0.01691861629486084, "grad_norm": 0.013693725690245628, "learning_rate": 8.226747305449918e-05, "epoch": 2.9128163921253516, "step": 7250 }, { "loss": 0.011077804565429688, "grad_norm": 0.05239178612828255, "learning_rate": 8.202082121900441e-05, "epoch": 2.932904781036561, "step": 7300 }, { "loss": 0.005902353525161743, "grad_norm": 0.011177760548889637, "learning_rate": 8.177284123353562e-05, "epoch": 2.9529931699477703, "step": 7350 }, { "loss": 0.005208334922790527, "grad_norm": 0.039729222655296326, "learning_rate": 8.152354338373189e-05, "epoch": 2.9730815588589796, "step": 7400 }, { "loss": 0.004365023374557495, "grad_norm": 0.007116931024938822, "learning_rate": 8.127293800989434e-05, "epoch": 2.993169947770189, "step": 7450 }, { "loss": 0.004765605926513672, "grad_norm": 0.04476737603545189, "learning_rate": 8.102103550655718e-05, "epoch": 3.0132583366813983, "step": 7500 }, { "eval_seen_loss": 0.01588328927755356, "eval_seen_accuracy": 0.9954710144927537, "eval_seen_f1_valid": 0.9964522232734153, "eval_seen_f1_invalid": 0.9937395659432388, "eval_seen_macro_f1": 0.995095894608327, "eval_seen_majority_baseline": 0.6400966183574879, "eval_seen_runtime": 0.3304, "eval_seen_samples_per_second": 20050.206, "eval_seen_steps_per_second": 157.399, "epoch": 3.0132583366813983, "step": 7500 }, { "eval_unseen_loss": 0.10731399804353714, "eval_unseen_accuracy": 0.9735809178743962, "eval_unseen_f1_valid": 0.9791144527986633, "eval_unseen_f1_invalid": 0.9640583281988088, "eval_unseen_macro_f1": 0.9715863904987361, "eval_unseen_majority_baseline": 0.6400966183574879, "eval_unseen_runtime": 0.3153, "eval_unseen_samples_per_second": 21009.724, "eval_unseen_steps_per_second": 164.931, "epoch": 3.0132583366813983, "step": 7500 }, { "loss": 0.002300529181957245, "grad_norm": 0.5621789693832397, "learning_rate": 8.076784632205647e-05, "epoch": 3.0333467255926077, "step": 7550 }, { "loss": 0.007070068120956421, "grad_norm": 0.015566053800284863, "learning_rate": 8.0513380958097e-05, "epoch": 3.053435114503817, "step": 7600 }, { "loss": 0.00422912985086441, "grad_norm": 6.171871185302734, "learning_rate": 8.025764996931638e-05, "epoch": 3.073523503415026, "step": 7650 }, { "loss": 0.011097090244293213, "grad_norm": 0.01741686835885048, "learning_rate": 8.000066396284756e-05, "epoch": 3.0936118923262352, "step": 7700 }, { "loss": 0.005830162763595581, "grad_norm": 0.019328523427248, "learning_rate": 7.974243359787865e-05, "epoch": 3.1137002812374446, "step": 7750 }, { "loss": 0.0016254797577857972, "grad_norm": 0.006262289825826883, "learning_rate": 7.948296958521093e-05, "epoch": 3.133788670148654, "step": 7800 }, { "loss": 0.005305635333061218, "grad_norm": 0.0055910260416567326, "learning_rate": 7.922228268681456e-05, "epoch": 3.1538770590598633, "step": 7850 }, { "loss": 0.004000791013240814, "grad_norm": 0.003951588179916143, "learning_rate": 7.896038371538213e-05, "epoch": 3.1739654479710726, "step": 7900 }, { "loss": 0.0049227488040924075, "grad_norm": 0.007216272410005331, "learning_rate": 7.869728353388026e-05, "epoch": 3.194053836882282, "step": 7950 }, { "loss": 0.00094679094851017, "grad_norm": 0.002421668032184243, "learning_rate": 7.843299305509902e-05, "epoch": 3.2141422257934913, "step": 8000 }, { "eval_seen_loss": 0.01580193266272545, "eval_seen_accuracy": 0.9966787439613527, "eval_seen_f1_valid": 0.9974044360547428, "eval_seen_f1_invalid": 0.9953897736797988, "eval_seen_macro_f1": 0.9963971048672708, "eval_seen_majority_baseline": 0.6400966183574879, "eval_seen_runtime": 0.3176, "eval_seen_samples_per_second": 20857.221, "eval_seen_steps_per_second": 163.734, "epoch": 3.2141422257934913, "step": 8000 }, { "eval_unseen_loss": 0.028369244188070297, "eval_unseen_accuracy": 0.9936594202898551, "eval_unseen_f1_valid": 0.9950460014154282, "eval_unseen_f1_invalid": 0.9911949685534591, "eval_unseen_macro_f1": 0.9931204849844437, "eval_unseen_majority_baseline": 0.6400966183574879, "eval_unseen_runtime": 0.3103, "eval_unseen_samples_per_second": 21345.059, "eval_unseen_steps_per_second": 167.564, "epoch": 3.2141422257934913, "step": 8000 }, { "loss": 0.010896263122558593, "grad_norm": 0.00519702909514308, "learning_rate": 7.816752324119924e-05, "epoch": 3.2342306147047006, "step": 8050 }, { "loss": 0.003296748399734497, "grad_norm": 0.0028257747180759907, "learning_rate": 7.790088510325788e-05, "epoch": 3.25431900361591, "step": 8100 }, { "loss": 0.006281962990760804, "grad_norm": 0.0049965763464570045, "learning_rate": 7.763308970081128e-05, "epoch": 3.2744073925271193, "step": 8150 }, { "loss": 0.0040089207887649535, "grad_norm": 0.004081875551491976, "learning_rate": 7.736414814139645e-05, "epoch": 3.2944957814383287, "step": 8200 }, { "loss": 0.00024588212370872496, "grad_norm": 0.003750850446522236, "learning_rate": 7.709407158009034e-05, "epoch": 3.314584170349538, "step": 8250 }, { "loss": 0.0010862263292074203, "grad_norm": 0.0021764510311186314, "learning_rate": 7.682287121904721e-05, "epoch": 3.3346725592607473, "step": 8300 }, { "loss": 0.005993441939353943, "grad_norm": 0.003460386535152793, "learning_rate": 7.655055830703391e-05, "epoch": 3.3547609481719567, "step": 8350 }, { "loss": 0.003086153566837311, "grad_norm": 0.021544523537158966, "learning_rate": 7.627714413896331e-05, "epoch": 3.374849337083166, "step": 8400 }, { "loss": 0.008029102087020875, "grad_norm": 0.008518628776073456, "learning_rate": 7.600264005542595e-05, "epoch": 3.3949377259943754, "step": 8450 }, { "loss": 0.0035008740425109862, "grad_norm": 0.0039153690449893475, "learning_rate": 7.572705744221945e-05, "epoch": 3.4150261149055847, "step": 8500 }, { "eval_seen_loss": 0.01266945619136095, "eval_seen_accuracy": 0.997433574879227, "eval_seen_f1_valid": 0.9979955193962976, "eval_seen_f1_invalid": 0.9964338158170758, "eval_seen_macro_f1": 0.9972146676066866, "eval_seen_majority_baseline": 0.6400966183574879, "eval_seen_runtime": 0.3186, "eval_seen_samples_per_second": 20790.062, "eval_seen_steps_per_second": 163.207, "epoch": 3.4150261149055847, "step": 8500 }, { "eval_unseen_loss": 0.027893278747797012, "eval_unseen_accuracy": 0.9921497584541062, "eval_unseen_f1_valid": 0.9938592347661785, "eval_unseen_f1_invalid": 0.9891213389121338, "eval_unseen_macro_f1": 0.9914902868391562, "eval_unseen_majority_baseline": 0.6400966183574879, "eval_unseen_runtime": 0.3113, "eval_unseen_samples_per_second": 21277.888, "eval_unseen_steps_per_second": 167.037, "epoch": 3.4150261149055847, "step": 8500 }, { "loss": 0.0038093182444572447, "grad_norm": 0.00725920032709837, "learning_rate": 7.545040772987641e-05, "epoch": 3.435114503816794, "step": 8550 }, { "loss": 0.00811230182647705, "grad_norm": 0.019070835784077644, "learning_rate": 7.517270239319026e-05, "epoch": 3.4552028927280034, "step": 8600 }, { "loss": 0.00710671603679657, "grad_norm": 0.01030392199754715, "learning_rate": 7.489395295073926e-05, "epoch": 3.4752912816392127, "step": 8650 }, { "loss": 0.004966625869274139, "grad_norm": 0.01758037507534027, "learning_rate": 7.46141709644088e-05, "epoch": 3.495379670550422, "step": 8700 }, { "loss": 0.008438785076141358, "grad_norm": 0.02527831308543682, "learning_rate": 7.433336803891177e-05, "epoch": 3.5154680594616314, "step": 8750 }, { "loss": 0.004293153584003448, "grad_norm": 0.28978201746940613, "learning_rate": 7.405155582130736e-05, "epoch": 3.5355564483728403, "step": 8800 }, { "loss": 0.008686498403549195, "grad_norm": 0.004737816285341978, "learning_rate": 7.376874600051778e-05, "epoch": 3.5556448372840497, "step": 8850 }, { "loss": 0.0028849306702613832, "grad_norm": 0.003080884926021099, "learning_rate": 7.348495030684358e-05, "epoch": 3.575733226195259, "step": 8900 }, { "loss": 0.00820321500301361, "grad_norm": 0.014155007898807526, "learning_rate": 7.320018051147699e-05, "epoch": 3.5958216151064684, "step": 8950 }, { "loss": 0.0075477021932601925, "grad_norm": 0.8712772727012634, "learning_rate": 7.291444842601382e-05, "epoch": 3.6159100040176777, "step": 9000 }, { "eval_seen_loss": 0.010590881109237671, "eval_seen_accuracy": 0.997433574879227, "eval_seen_f1_valid": 0.9979936268145875, "eval_seen_f1_invalid": 0.9964397905759161, "eval_seen_macro_f1": 0.9972167086952518, "eval_seen_majority_baseline": 0.6400966183574879, "eval_seen_runtime": 0.3229, "eval_seen_samples_per_second": 20512.361, "eval_seen_steps_per_second": 161.027, "epoch": 3.6159100040176777, "step": 9000 }, { "eval_unseen_loss": 0.039689332246780396, "eval_unseen_accuracy": 0.9910929951690821, "eval_unseen_f1_valid": 0.9930465527401295, "eval_unseen_f1_invalid": 0.9876128490447197, "eval_unseen_macro_f1": 0.9903297008924246, "eval_unseen_majority_baseline": 0.6400966183574879, "eval_unseen_runtime": 0.3101, "eval_unseen_samples_per_second": 21363.737, "eval_unseen_steps_per_second": 167.71, "epoch": 3.6159100040176777, "step": 9000 }, { "loss": 0.00436368465423584, "grad_norm": 0.0035482132807374, "learning_rate": 7.26277659019634e-05, "epoch": 3.635998392928887, "step": 9050 }, { "loss": 0.009257551431655884, "grad_norm": 0.026822760701179504, "learning_rate": 7.234014483025708e-05, "epoch": 3.6560867818400964, "step": 9100 }, { "loss": 0.004030225574970245, "grad_norm": 0.01450075302273035, "learning_rate": 7.205159714075501e-05, "epoch": 3.6761751707513057, "step": 9150 }, { "loss": 0.005230934023857116, "grad_norm": 0.034596361219882965, "learning_rate": 7.176213480175129e-05, "epoch": 3.696263559662515, "step": 9200 }, { "loss": 0.004835358262062073, "grad_norm": 0.014685052447021008, "learning_rate": 7.147176981947761e-05, "epoch": 3.7163519485737244, "step": 9250 }, { "loss": 0.0010214821994304656, "grad_norm": 0.01088032592087984, "learning_rate": 7.118051423760521e-05, "epoch": 3.7364403374849338, "step": 9300 }, { "loss": 0.0020134617388248444, "grad_norm": 0.0023934361524879932, "learning_rate": 7.088838013674537e-05, "epoch": 3.756528726396143, "step": 9350 }, { "loss": 0.011201596260070801, "grad_norm": 0.051524143666028976, "learning_rate": 7.059537963394827e-05, "epoch": 3.7766171153073524, "step": 9400 }, { "loss": 0.011317558288574218, "grad_norm": 0.04817855358123779, "learning_rate": 7.030152488220052e-05, "epoch": 3.796705504218562, "step": 9450 }, { "loss": 0.007253561615943909, "grad_norm": 0.05064212903380394, "learning_rate": 7.000682806992094e-05, "epoch": 3.816793893129771, "step": 9500 }, { "eval_seen_loss": 0.015345041640102863, "eval_seen_accuracy": 0.996225845410628, "eval_seen_f1_valid": 0.9970473603401441, "eval_seen_f1_invalid": 0.9947709684166491, "eval_seen_macro_f1": 0.9959091643783966, "eval_seen_majority_baseline": 0.6400966183574879, "eval_seen_runtime": 0.3207, "eval_seen_samples_per_second": 20651.644, "eval_seen_steps_per_second": 162.12, "epoch": 3.816793893129771, "step": 9500 }, { "eval_unseen_loss": 0.06220504641532898, "eval_unseen_accuracy": 0.9889794685990339, "eval_unseen_f1_valid": 0.9913640127765291, "eval_unseen_f1_invalid": 0.9847758081334724, "eval_unseen_macro_f1": 0.9880699104550008, "eval_unseen_majority_baseline": 0.6400966183574879, "eval_unseen_runtime": 0.3133, "eval_unseen_samples_per_second": 21143.712, "eval_unseen_steps_per_second": 165.983, "epoch": 3.816793893129771, "step": 9500 }, { "loss": 0.0028853157162666322, "grad_norm": 0.02075340412557125, "learning_rate": 6.97113014204551e-05, "epoch": 3.8368822820409805, "step": 9550 }, { "loss": 0.010675743818283082, "grad_norm": 0.03223203495144844, "learning_rate": 6.941495719156834e-05, "epoch": 3.8569706709521894, "step": 9600 }, { "loss": 0.005665901899337768, "grad_norm": 0.0044933464378118515, "learning_rate": 6.911780767493729e-05, "epoch": 3.8770590598633987, "step": 9650 }, { "loss": 0.007787343263626099, "grad_norm": 9.683483123779297, "learning_rate": 6.881986519564006e-05, "epoch": 3.897147448774608, "step": 9700 }, { "loss": 0.009898404479026795, "grad_norm": 5.278289318084717, "learning_rate": 6.852114211164502e-05, "epoch": 3.9172358376858174, "step": 9750 }, { "loss": 0.0028400224447250365, "grad_norm": 0.006490530911833048, "learning_rate": 6.822165081329826e-05, "epoch": 3.9373242265970267, "step": 9800 }, { "loss": 0.002898951768875122, "grad_norm": 2.960984230041504, "learning_rate": 6.79214037228096e-05, "epoch": 3.957412615508236, "step": 9850 }, { "loss": 0.00907094955444336, "grad_norm": 0.04198857396841049, "learning_rate": 6.762041329373739e-05, "epoch": 3.9775010044194454, "step": 9900 }, { "loss": 0.006905393600463867, "grad_norm": 0.14619038999080658, "learning_rate": 6.731869201047192e-05, "epoch": 3.9975893933306548, "step": 9950 }, { "loss": 0.009627650380134583, "grad_norm": 0.016034724190831184, "learning_rate": 6.701625238771774e-05, "epoch": 4.017677782241864, "step": 10000 }, { "eval_seen_loss": 0.011894118040800095, "eval_seen_accuracy": 0.9969806763285024, "eval_seen_f1_valid": 0.9976403964134026, "eval_seen_f1_invalid": 0.9958088851634533, "eval_seen_macro_f1": 0.996724640788428, "eval_seen_majority_baseline": 0.6400966183574879, "eval_seen_runtime": 0.329, "eval_seen_samples_per_second": 20131.157, "eval_seen_steps_per_second": 158.034, "epoch": 4.017677782241864, "step": 10000 }, { "eval_unseen_loss": 0.03878156840801239, "eval_unseen_accuracy": 0.9882246376811594, "eval_unseen_f1_valid": 0.9907866761162296, "eval_unseen_f1_invalid": 0.983688833124216, "eval_unseen_macro_f1": 0.9872377546202228, "eval_unseen_majority_baseline": 0.6400966183574879, "eval_unseen_runtime": 0.3023, "eval_unseen_samples_per_second": 21913.894, "eval_unseen_steps_per_second": 172.029, "epoch": 4.017677782241864, "step": 10000 }, { "loss": 0.005427371263504028, "grad_norm": 0.005436044652014971, "learning_rate": 6.67131069699743e-05, "epoch": 4.0377661711530735, "step": 10050 }, { "loss": 0.0034640106558799745, "grad_norm": 0.06325726956129074, "learning_rate": 6.640926833101597e-05, "epoch": 4.057854560064283, "step": 10100 }, { "loss": 0.0027718636393547057, "grad_norm": 0.0038235979154706, "learning_rate": 6.610474907337023e-05, "epoch": 4.077942948975492, "step": 10150 }, { "loss": 0.0030018627643585206, "grad_norm": 0.005502292420715094, "learning_rate": 6.579956182779509e-05, "epoch": 4.0980313378867015, "step": 10200 }, { "loss": 0.006214578151702881, "grad_norm": 0.006388835608959198, "learning_rate": 6.549371925275516e-05, "epoch": 4.118119726797911, "step": 10250 }, { "loss": 0.004299657046794891, "grad_norm": 0.02509908750653267, "learning_rate": 6.518723403389662e-05, "epoch": 4.13820811570912, "step": 10300 }, { "loss": 0.0021544244885444643, "grad_norm": 0.004356733988970518, "learning_rate": 6.488011888352102e-05, "epoch": 4.1582965046203295, "step": 10350 }, { "loss": 0.002441017180681229, "grad_norm": 0.012465689331293106, "learning_rate": 6.457238654005805e-05, "epoch": 4.178384893531539, "step": 10400 }, { "loss": 0.005048474669456482, "grad_norm": 0.0057596489787101746, "learning_rate": 6.42640497675371e-05, "epoch": 4.198473282442748, "step": 10450 }, { "loss": 0.0016454234719276428, "grad_norm": 0.752906322479248, "learning_rate": 6.395512135505794e-05, "epoch": 4.2185616713539575, "step": 10500 }, { "eval_seen_loss": 0.021507009863853455, "eval_seen_accuracy": 0.9957729468599034, "eval_seen_f1_valid": 0.9967004477963705, "eval_seen_f1_invalid": 0.994120117597648, "eval_seen_macro_f1": 0.9954102826970093, "eval_seen_majority_baseline": 0.6400966183574879, "eval_seen_runtime": 0.315, "eval_seen_samples_per_second": 21030.908, "eval_seen_steps_per_second": 165.098, "epoch": 4.2185616713539575, "step": 10500 }, { "eval_unseen_loss": 0.04845276474952698, "eval_unseen_accuracy": 0.9897342995169082, "eval_unseen_f1_valid": 0.9919488515273502, "eval_unseen_f1_invalid": 0.9858392336526446, "eval_unseen_macro_f1": 0.9888940425899975, "eval_unseen_majority_baseline": 0.6400966183574879, "eval_unseen_runtime": 0.31, "eval_unseen_samples_per_second": 21366.218, "eval_unseen_steps_per_second": 167.73, "epoch": 4.2185616713539575, "step": 10500 }, { "loss": 0.00538996934890747, "grad_norm": 0.0065927463583648205, "learning_rate": 6.364561411626013e-05, "epoch": 4.238650060265167, "step": 10550 }, { "loss": 0.0015137888491153716, "grad_norm": 0.12535056471824646, "learning_rate": 6.333554088879173e-05, "epoch": 4.258738449176376, "step": 10600 }, { "loss": 0.005469639897346497, "grad_norm": 0.1713482290506363, "learning_rate": 6.302491453377655e-05, "epoch": 4.278826838087586, "step": 10650 }, { "loss": 0.0035777607560157775, "grad_norm": 0.0622786246240139, "learning_rate": 6.271374793528103e-05, "epoch": 4.298915226998795, "step": 10700 }, { "loss": 0.0011316427588462829, "grad_norm": 0.0019172088941559196, "learning_rate": 6.240205399977955e-05, "epoch": 4.319003615910004, "step": 10750 }, { "loss": 0.0026168256998062136, "grad_norm": 0.005300440359860659, "learning_rate": 6.208984565561921e-05, "epoch": 4.339092004821214, "step": 10800 }, { "loss": 0.006189553141593933, "grad_norm": 0.005188933108001947, "learning_rate": 6.17771358524837e-05, "epoch": 4.359180393732423, "step": 10850 }, { "loss": 0.008901360034942627, "grad_norm": 0.0037269098684191704, "learning_rate": 6.146393756085595e-05, "epoch": 4.379268782643632, "step": 10900 }, { "loss": 0.0011978115141391755, "grad_norm": 0.004762765485793352, "learning_rate": 6.115026377148037e-05, "epoch": 4.399357171554842, "step": 10950 }, { "loss": 0.0011883687973022461, "grad_norm": 0.0023202828597277403, "learning_rate": 6.083612749482388e-05, "epoch": 4.419445560466051, "step": 11000 }, { "eval_seen_loss": 0.008558264002203941, "eval_seen_accuracy": 0.9980374396135265, "eval_seen_f1_valid": 0.9984664385985609, "eval_seen_f1_invalid": 0.9972752043596731, "eval_seen_macro_f1": 0.997870821479117, "eval_seen_majority_baseline": 0.6400966183574879, "eval_seen_runtime": 0.3239, "eval_seen_samples_per_second": 20450.306, "eval_seen_steps_per_second": 160.54, "epoch": 4.419445560466051, "step": 11000 }, { "eval_unseen_loss": 0.0422622486948967, "eval_unseen_accuracy": 0.9889794685990339, "eval_unseen_f1_valid": 0.9913353115727003, "eval_unseen_f1_invalid": 0.9848641924113622, "eval_unseen_macro_f1": 0.9880997519920313, "eval_unseen_majority_baseline": 0.6400966183574879, "eval_unseen_runtime": 0.2973, "eval_unseen_samples_per_second": 22280.875, "eval_unseen_steps_per_second": 174.91, "epoch": 4.419445560466051, "step": 11000 }, { "loss": 0.003962970674037934, "grad_norm": 0.006651753559708595, "learning_rate": 6.052154176053626e-05, "epoch": 4.43953394937726, "step": 11050 }, { "loss": 0.000864512175321579, "grad_norm": 0.009494757279753685, "learning_rate": 6.0206519616909876e-05, "epoch": 4.45962233828847, "step": 11100 }, { "loss": 0.00789304792881012, "grad_norm": 0.003297999268397689, "learning_rate": 5.9891074130338207e-05, "epoch": 4.479710727199679, "step": 11150 }, { "loss": 0.0034743845462799072, "grad_norm": 0.009166165255010128, "learning_rate": 5.957521838477414e-05, "epoch": 4.4997991161108875, "step": 11200 }, { "loss": 0.004978830218315125, "grad_norm": 0.0029759351164102554, "learning_rate": 5.9258965481187126e-05, "epoch": 4.519887505022098, "step": 11250 }, { "loss": 0.0007813534885644913, "grad_norm": 0.023890171200037003, "learning_rate": 5.8942328537019766e-05, "epoch": 4.539975893933306, "step": 11300 }, { "loss": 0.0031626516580581664, "grad_norm": 0.0044487579725682735, "learning_rate": 5.8625320685643834e-05, "epoch": 4.5600642828445155, "step": 11350 }, { "loss": 0.0036859130859375, "grad_norm": 0.022548481822013855, "learning_rate": 5.83079550758155e-05, "epoch": 4.580152671755725, "step": 11400 }, { "loss": 0.0005728846788406372, "grad_norm": 0.0019822390750050545, "learning_rate": 5.799024487112986e-05, "epoch": 4.600241060666934, "step": 11450 }, { "loss": 0.005244595408439637, "grad_norm": 0.0025443369522690773, "learning_rate": 5.767220324947509e-05, "epoch": 4.6203294495781435, "step": 11500 }, { "eval_seen_loss": 0.007967733778059483, "eval_seen_accuracy": 0.9981884057971014, "eval_seen_f1_valid": 0.9985852393303466, "eval_seen_f1_invalid": 0.9974821653378095, "eval_seen_macro_f1": 0.9980337023340781, "eval_seen_majority_baseline": 0.6400966183574879, "eval_seen_runtime": 0.3207, "eval_seen_samples_per_second": 20651.598, "eval_seen_steps_per_second": 162.12, "epoch": 4.6203294495781435, "step": 11500 }, { "eval_unseen_loss": 0.02163851074874401, "eval_unseen_accuracy": 0.9939613526570048, "eval_unseen_f1_valid": 0.9952852428099952, "eval_unseen_f1_invalid": 0.9916036943744752, "eval_unseen_macro_f1": 0.9934444685922352, "eval_unseen_majority_baseline": 0.6400966183574879, "eval_unseen_runtime": 0.2963, "eval_unseen_samples_per_second": 22358.064, "eval_unseen_steps_per_second": 175.516, "epoch": 4.6203294495781435, "step": 11500 }, { "loss": 0.0024283653497695922, "grad_norm": 0.002546750009059906, "learning_rate": 5.735384340248569e-05, "epoch": 4.640417838489353, "step": 11550 }, { "loss": 0.007456202507019043, "grad_norm": 0.0035354087594896555, "learning_rate": 5.703517853499553e-05, "epoch": 4.660506227400562, "step": 11600 }, { "loss": 0.0023691913485527037, "grad_norm": 4.495802402496338, "learning_rate": 5.671622186448989e-05, "epoch": 4.6805946163117715, "step": 11650 }, { "loss": 0.002830646634101868, "grad_norm": 0.0077832662500441074, "learning_rate": 5.639698662055751e-05, "epoch": 4.700683005222981, "step": 11700 }, { "loss": 0.0030017268657684328, "grad_norm": 0.018308039754629135, "learning_rate": 5.607748604434161e-05, "epoch": 4.72077139413419, "step": 11750 }, { "loss": 0.00012694787234067916, "grad_norm": 0.0019742785952985287, "learning_rate": 5.575773338799083e-05, "epoch": 4.7408597830454, "step": 11800 }, { "loss": 0.003408160209655762, "grad_norm": 0.0017532280180603266, "learning_rate": 5.5437741914109485e-05, "epoch": 4.760948171956609, "step": 11850 }, { "loss": 0.0006748394668102264, "grad_norm": 0.009566946886479855, "learning_rate": 5.511752489520753e-05, "epoch": 4.781036560867818, "step": 11900 }, { "loss": 0.0019586144387722017, "grad_norm": 0.003580181859433651, "learning_rate": 5.4797095613149983e-05, "epoch": 4.801124949779028, "step": 11950 }, { "loss": 0.006813893914222717, "grad_norm": 0.016823643818497658, "learning_rate": 5.4476467358606044e-05, "epoch": 4.821213338690237, "step": 12000 }, { "eval_seen_loss": 0.011064874939620495, "eval_seen_accuracy": 0.9972826086956522, "eval_seen_f1_valid": 0.99787785899552, "eval_seen_f1_invalid": 0.9962232480067142, "eval_seen_macro_f1": 0.9970505535011172, "eval_seen_majority_baseline": 0.6400966183574879, "eval_seen_runtime": 0.3175, "eval_seen_samples_per_second": 20860.995, "eval_seen_steps_per_second": 163.764, "epoch": 4.821213338690237, "step": 12000 }, { "eval_unseen_loss": 0.051994677633047104, "eval_unseen_accuracy": 0.9859601449275363, "eval_unseen_f1_valid": 0.9889953851615193, "eval_unseen_f1_invalid": 0.9806128830519075, "eval_unseen_macro_f1": 0.9848041341067134, "eval_unseen_majority_baseline": 0.6400966183574879, "eval_unseen_runtime": 0.3132, "eval_unseen_samples_per_second": 21152.179, "eval_unseen_steps_per_second": 166.05, "epoch": 4.821213338690237, "step": 12000 }, { "loss": 0.0032321390509605407, "grad_norm": 0.00454537570476532, "learning_rate": 5.415565343049785e-05, "epoch": 4.841301727601446, "step": 12050 }, { "loss": 0.0032006219029426576, "grad_norm": 6.071142673492432, "learning_rate": 5.383466713544886e-05, "epoch": 4.861390116512656, "step": 12100 }, { "loss": 0.00025400251150131225, "grad_norm": 0.0011727007804438472, "learning_rate": 5.351352178723186e-05, "epoch": 4.881478505423865, "step": 12150 }, { "loss": 0.002920109033584595, "grad_norm": 0.01371962670236826, "learning_rate": 5.319223070621688e-05, "epoch": 4.901566894335074, "step": 12200 }, { "loss": 0.00021828394383192063, "grad_norm": 0.0007112867897376418, "learning_rate": 5.287080721881854e-05, "epoch": 4.921655283246284, "step": 12250 }, { "loss": 0.0014558228850364684, "grad_norm": 0.001511621754616499, "learning_rate": 5.254926465694341e-05, "epoch": 4.941743672157493, "step": 12300 }, { "loss": 0.005796372890472412, "grad_norm": 0.20507988333702087, "learning_rate": 5.222761635743697e-05, "epoch": 4.961832061068702, "step": 12350 }, { "loss": 0.005083301663398742, "grad_norm": 0.0018521308666095138, "learning_rate": 5.190587566153049e-05, "epoch": 4.981920449979912, "step": 12400 }, { "loss": 0.0006556917726993561, "grad_norm": 0.0016021252376958728, "learning_rate": 5.15840559142876e-05, "epoch": 5.002008838891121, "step": 12450 }, { "loss": 0.0015148460865020753, "grad_norm": 0.0033229379914700985, "learning_rate": 5.12621704640508e-05, "epoch": 5.02209722780233, "step": 12500 }, { "eval_seen_loss": 0.016905121505260468, "eval_seen_accuracy": 0.996225845410628, "eval_seen_f1_valid": 0.997052929388188, "eval_seen_f1_invalid": 0.994753410283316, "eval_seen_macro_f1": 0.995903169835752, "eval_seen_majority_baseline": 0.6400966183574879, "eval_seen_runtime": 0.3193, "eval_seen_samples_per_second": 20747.708, "eval_seen_steps_per_second": 162.875, "epoch": 5.02209722780233, "step": 12500 }, { "eval_unseen_loss": 0.08490641415119171, "eval_unseen_accuracy": 0.9846014492753623, "eval_unseen_f1_valid": 0.9879232772910254, "eval_unseen_f1_invalid": 0.9787588504789672, "eval_unseen_macro_f1": 0.9833410638849962, "eval_unseen_majority_baseline": 0.6400966183574879, "eval_unseen_runtime": 0.3059, "eval_unseen_samples_per_second": 21657.606, "eval_unseen_steps_per_second": 170.017, "epoch": 5.02209722780233, "step": 12500 }, { "loss": 0.00185398668050766, "grad_norm": 0.0010378584265708923, "learning_rate": 5.09402326618878e-05, "epoch": 5.04218561671354, "step": 12550 }, { "loss": 0.0015885192155838013, "grad_norm": 0.0015575550496578217, "learning_rate": 5.0618255861037776e-05, "epoch": 5.062274005624749, "step": 12600 }, { "loss": 0.00361468642950058, "grad_norm": 0.001530500827357173, "learning_rate": 5.029625341635743e-05, "epoch": 5.082362394535958, "step": 12650 }, { "loss": 7.036324590444565e-05, "grad_norm": 0.0011731426930055022, "learning_rate": 4.9974238683767154e-05, "epoch": 5.102450783447168, "step": 12700 }, { "loss": 0.00022802915424108505, "grad_norm": 0.0010616343934088945, "learning_rate": 4.9652225019696986e-05, "epoch": 5.122539172358377, "step": 12750 }, { "loss": 0.002062407433986664, "grad_norm": 0.0012495917035266757, "learning_rate": 4.9330225780532654e-05, "epoch": 5.142627561269586, "step": 12800 }, { "loss": 0.0007111681997776032, "grad_norm": 0.09994599968194962, "learning_rate": 4.9008254322061595e-05, "epoch": 5.162715950180796, "step": 12850 }, { "loss": 0.0007095547020435334, "grad_norm": 0.0009567381348460913, "learning_rate": 4.868632399891892e-05, "epoch": 5.182804339092005, "step": 12900 }, { "loss": 6.402432918548585e-05, "grad_norm": 0.0007548440480604768, "learning_rate": 4.83644481640336e-05, "epoch": 5.2028927280032145, "step": 12950 }, { "loss": 0.0011706628650426864, "grad_norm": 0.0007474229787476361, "learning_rate": 4.804264016807448e-05, "epoch": 5.222981116914424, "step": 13000 }, { "eval_seen_loss": 0.007674613501876593, "eval_seen_accuracy": 0.9981884057971014, "eval_seen_f1_valid": 0.9985845718329796, "eval_seen_f1_invalid": 0.9974842767295596, "eval_seen_macro_f1": 0.9980344242812695, "eval_seen_majority_baseline": 0.6400966183574879, "eval_seen_runtime": 0.3285, "eval_seen_samples_per_second": 20167.265, "eval_seen_steps_per_second": 158.318, "epoch": 5.222981116914424, "step": 13000 }, { "eval_unseen_loss": 0.06615690886974335, "eval_unseen_accuracy": 0.9891304347826086, "eval_unseen_f1_valid": 0.9914953933380581, "eval_unseen_f1_invalid": 0.9849435382685069, "eval_unseen_macro_f1": 0.9882194658032826, "eval_unseen_majority_baseline": 0.6400966183574879, "eval_unseen_runtime": 0.3195, "eval_unseen_samples_per_second": 20734.098, "eval_unseen_steps_per_second": 162.768, "epoch": 5.222981116914424, "step": 13000 }, { "loss": 0.0001120208203792572, "grad_norm": 0.0006617383914999664, "learning_rate": 4.7720913358896704e-05, "epoch": 5.243069505825633, "step": 13050 }, { "loss": 0.0048398998379707335, "grad_norm": 0.39095479249954224, "learning_rate": 4.739928108098789e-05, "epoch": 5.2631578947368425, "step": 13100 }, { "loss": 0.0014353193342685699, "grad_norm": 0.011521922424435616, "learning_rate": 4.707775667491475e-05, "epoch": 5.283246283648052, "step": 13150 }, { "loss": 0.0021208491921424866, "grad_norm": 0.04535406082868576, "learning_rate": 4.675635347676971e-05, "epoch": 5.303334672559261, "step": 13200 }, { "loss": 0.0013151970505714417, "grad_norm": 0.0014821949880570173, "learning_rate": 4.6435084817617805e-05, "epoch": 5.32342306147047, "step": 13250 }, { "loss": 3.317750990390778e-05, "grad_norm": 0.003384900977835059, "learning_rate": 4.611396402294364e-05, "epoch": 5.34351145038168, "step": 13300 }, { "loss": 0.0002364267036318779, "grad_norm": 0.0017969327745959163, "learning_rate": 4.579300441209881e-05, "epoch": 5.363599839292888, "step": 13350 }, { "loss": 0.0044511440396308895, "grad_norm": 0.00422246940433979, "learning_rate": 4.5472219297749306e-05, "epoch": 5.383688228204098, "step": 13400 }, { "loss": 0.006281139850616455, "grad_norm": 0.006894610356539488, "learning_rate": 4.515162198532349e-05, "epoch": 5.403776617115307, "step": 13450 }, { "loss": 0.005771521329879761, "grad_norm": 0.0020705130882561207, "learning_rate": 4.4831225772460045e-05, "epoch": 5.423865006026516, "step": 13500 }, { "eval_seen_loss": 0.010174693539738655, "eval_seen_accuracy": 0.9971316425120773, "eval_seen_f1_valid": 0.9977586410286657, "eval_seen_f1_invalid": 0.9960176063718298, "eval_seen_macro_f1": 0.9968881237002478, "eval_seen_majority_baseline": 0.6400966183574879, "eval_seen_runtime": 0.3169, "eval_seen_samples_per_second": 20903.498, "eval_seen_steps_per_second": 164.098, "epoch": 5.423865006026516, "step": 13500 }, { "eval_unseen_loss": 0.058374982327222824, "eval_unseen_accuracy": 0.9894323671497585, "eval_unseen_f1_valid": 0.99176664314279, "eval_unseen_f1_invalid": 0.9852507374631267, "eval_unseen_macro_f1": 0.9885086903029583, "eval_unseen_majority_baseline": 0.6400966183574879, "eval_unseen_runtime": 0.3043, "eval_unseen_samples_per_second": 21769.42, "eval_unseen_steps_per_second": 170.895, "epoch": 5.423865006026516, "step": 13500 }, { "loss": 0.0006757942587137223, "grad_norm": 0.004422497004270554, "learning_rate": 4.451104394845656e-05, "epoch": 5.443953394937726, "step": 13550 }, { "loss": 0.0002531594038009644, "grad_norm": 0.001529279863461852, "learning_rate": 4.419108979371825e-05, "epoch": 5.464041783848935, "step": 13600 }, { "loss": 0.0036075374484062193, "grad_norm": 0.006333576515316963, "learning_rate": 4.387137657920714e-05, "epoch": 5.484130172760144, "step": 13650 }, { "loss": 0.00012090455740690231, "grad_norm": 0.0038246733602136374, "learning_rate": 4.355191756589162e-05, "epoch": 5.504218561671354, "step": 13700 }, { "loss": 0.001714312881231308, "grad_norm": 0.005397704429924488, "learning_rate": 4.323272600419636e-05, "epoch": 5.524306950582563, "step": 13750 }, { "loss": 0.0036899104714393617, "grad_norm": 5.890677452087402, "learning_rate": 4.2913815133452775e-05, "epoch": 5.544395339493772, "step": 13800 }, { "loss": 0.00011864371597766876, "grad_norm": 0.0025099259801208973, "learning_rate": 4.2595198181349906e-05, "epoch": 5.564483728404982, "step": 13850 }, { "loss": 0.0008606189489364625, "grad_norm": 0.0009816354140639305, "learning_rate": 4.2276888363385654e-05, "epoch": 5.584572117316191, "step": 13900 }, { "loss": 0.0009802313148975373, "grad_norm": 0.0008119562990032136, "learning_rate": 4.195889888231875e-05, "epoch": 5.6046605062274, "step": 13950 }, { "loss": 0.0024506640434265137, "grad_norm": 0.000700517965015024, "learning_rate": 4.164124292762105e-05, "epoch": 5.62474889513861, "step": 14000 }, { "eval_seen_loss": 0.009596684016287327, "eval_seen_accuracy": 0.9978864734299517, "eval_seen_f1_valid": 0.9983498349834984, "eval_seen_f1_invalid": 0.9970612930310664, "eval_seen_macro_f1": 0.9977055640072824, "eval_seen_majority_baseline": 0.6400966183574879, "eval_seen_runtime": 0.3205, "eval_seen_samples_per_second": 20670.343, "eval_seen_steps_per_second": 162.267, "epoch": 5.62474889513861, "step": 14000 }, { "eval_unseen_loss": 0.08425682038068771, "eval_unseen_accuracy": 0.9808272946859904, "eval_unseen_f1_valid": 0.9849186557415984, "eval_unseen_f1_invalid": 0.9736896623161384, "eval_unseen_macro_f1": 0.9793041590288685, "eval_unseen_majority_baseline": 0.6400966183574879, "eval_unseen_runtime": 0.3167, "eval_unseen_samples_per_second": 20912.766, "eval_unseen_steps_per_second": 164.17, "epoch": 5.62474889513861, "step": 14000 }, { "loss": 0.0036605629324913025, "grad_norm": 0.00505917239934206, "learning_rate": 4.1323933674930546e-05, "epoch": 5.644837284049819, "step": 14050 }, { "loss": 0.0009563095867633819, "grad_norm": 0.004556451458483934, "learning_rate": 4.100698428550483e-05, "epoch": 5.6649256729610284, "step": 14100 }, { "loss": 0.0005329408496618271, "grad_norm": 0.0008073868812061846, "learning_rate": 4.069040790567514e-05, "epoch": 5.685014061872238, "step": 14150 }, { "loss": 0.0020050498843193054, "grad_norm": 6.619334697723389, "learning_rate": 4.0374217666301165e-05, "epoch": 5.705102450783447, "step": 14200 }, { "loss": 0.006490317583084107, "grad_norm": 0.0027281667571514845, "learning_rate": 4.0058426682226404e-05, "epoch": 5.7251908396946565, "step": 14250 }, { "loss": 0.0007787179946899414, "grad_norm": 0.004724098369479179, "learning_rate": 3.974304805173415e-05, "epoch": 5.745279228605866, "step": 14300 }, { "loss": 3.9987266063690186e-05, "grad_norm": 0.0007951312582008541, "learning_rate": 3.942809485600417e-05, "epoch": 5.765367617517075, "step": 14350 }, { "loss": 0.00021765440702438356, "grad_norm": 0.008279331028461456, "learning_rate": 3.911358015857023e-05, "epoch": 5.7854560064282845, "step": 14400 }, { "loss": 0.003879154920578003, "grad_norm": 0.1304825246334076, "learning_rate": 3.879951700477821e-05, "epoch": 5.805544395339494, "step": 14450 }, { "loss": 0.004461580812931061, "grad_norm": 0.002032057149335742, "learning_rate": 3.8485918421244934e-05, "epoch": 5.825632784250703, "step": 14500 }, { "eval_seen_loss": 0.010054807178676128, "eval_seen_accuracy": 0.9977355072463768, "eval_seen_f1_valid": 0.9982305060752625, "eval_seen_f1_invalid": 0.996856005030392, "eval_seen_macro_f1": 0.9975432555528272, "eval_seen_majority_baseline": 0.6400966183574879, "eval_seen_runtime": 0.3332, "eval_seen_samples_per_second": 19879.214, "eval_seen_steps_per_second": 156.057, "epoch": 5.825632784250703, "step": 14500 }, { "eval_unseen_loss": 0.07361596077680588, "eval_unseen_accuracy": 0.9846014492753623, "eval_unseen_f1_valid": 0.9879289940828402, "eval_unseen_f1_invalid": 0.9787411421425594, "eval_unseen_macro_f1": 0.9833350681126998, "eval_unseen_majority_baseline": 0.6400966183574879, "eval_unseen_runtime": 0.2998, "eval_unseen_samples_per_second": 22098.303, "eval_unseen_steps_per_second": 173.477, "epoch": 5.825632784250703, "step": 14500 }, { "loss": 0.00021345250308513642, "grad_norm": 0.0009313533664681017, "learning_rate": 3.8172797415317974e-05, "epoch": 5.8457211731619125, "step": 14550 }, { "loss": 0.0028869000077247618, "grad_norm": 0.002781760646030307, "learning_rate": 3.786016697453604e-05, "epoch": 5.865809562073122, "step": 14600 }, { "loss": 0.0006874355673789978, "grad_norm": 0.005940814968198538, "learning_rate": 3.7548040066090386e-05, "epoch": 5.885897950984331, "step": 14650 }, { "loss": 0.002895154058933258, "grad_norm": 0.005510283168405294, "learning_rate": 3.723642963628686e-05, "epoch": 5.905986339895541, "step": 14700 }, { "loss": 0.001371142715215683, "grad_norm": 0.024149959906935692, "learning_rate": 3.692534861000897e-05, "epoch": 5.92607472880675, "step": 14750 }, { "loss": 0.0004990202561020852, "grad_norm": 2.1117215156555176, "learning_rate": 3.661480989018177e-05, "epoch": 5.946163117717959, "step": 14800 }, { "loss": 0.0032197386026382446, "grad_norm": 0.0015058110002428293, "learning_rate": 3.6304826357236765e-05, "epoch": 5.966251506629169, "step": 14850 }, { "loss": 0.0005698489025235176, "grad_norm": 0.004746470134705305, "learning_rate": 3.599541086857748e-05, "epoch": 5.986339895540378, "step": 14900 }, { "loss": 0.0002272239327430725, "grad_norm": 0.0004718729469459504, "learning_rate": 3.5686576258046344e-05, "epoch": 6.006428284451587, "step": 14950 }, { "loss": 0.0030455261468887327, "grad_norm": 0.03686371073126793, "learning_rate": 3.5378335335392245e-05, "epoch": 6.026516673362797, "step": 15000 }, { "eval_seen_loss": 0.01733102835714817, "eval_seen_accuracy": 0.9977355072463768, "eval_seen_f1_valid": 0.9982321744254568, "eval_seen_f1_invalid": 0.9968507243334034, "eval_seen_macro_f1": 0.9975414493794301, "eval_seen_majority_baseline": 0.6400966183574879, "eval_seen_runtime": 0.3365, "eval_seen_samples_per_second": 19686.252, "eval_seen_steps_per_second": 154.542, "epoch": 6.026516673362797, "step": 15000 }, { "eval_unseen_loss": 0.06736034899950027, "eval_unseen_accuracy": 0.986262077294686, "eval_unseen_f1_valid": 0.989237137788291, "eval_unseen_f1_invalid": 0.9810139787189651, "eval_unseen_macro_f1": 0.985125558253628, "eval_unseen_majority_baseline": 0.6400966183574879, "eval_unseen_runtime": 0.3306, "eval_unseen_samples_per_second": 20034.851, "eval_unseen_steps_per_second": 157.278, "epoch": 6.026516673362797, "step": 15000 }, { "loss": 0.00037648912519216537, "grad_norm": 0.000664414488710463, "learning_rate": 3.507070088573934e-05, "epoch": 6.046605062274006, "step": 15050 }, { "loss": 0.0020931462943553926, "grad_norm": 0.009824547916650772, "learning_rate": 3.4763685669056607e-05, "epoch": 6.066693451185215, "step": 15100 }, { "loss": 0.0007150228321552277, "grad_norm": 0.0012331090401858091, "learning_rate": 3.4457302419628706e-05, "epoch": 6.086781840096425, "step": 15150 }, { "loss": 2.3746751248836518e-05, "grad_norm": 0.0010286089964210987, "learning_rate": 3.4151563845527714e-05, "epoch": 6.106870229007634, "step": 15200 }, { "loss": 4.286464303731918e-05, "grad_norm": 0.0036701043136417866, "learning_rate": 3.3846482628086104e-05, "epoch": 6.126958617918843, "step": 15250 }, { "loss": 0.0011537586152553557, "grad_norm": 0.0007002303609624505, "learning_rate": 3.35420714213707e-05, "epoch": 6.147047006830052, "step": 15300 }, { "loss": 0.0002453260496258736, "grad_norm": 0.0014305695658549666, "learning_rate": 3.3238342851657786e-05, "epoch": 6.167135395741261, "step": 15350 }, { "loss": 0.0010268088430166245, "grad_norm": 0.02988343872129917, "learning_rate": 3.293530951690944e-05, "epoch": 6.1872237846524705, "step": 15400 }, { "loss": 0.0021796417236328125, "grad_norm": 0.0006717279902659357, "learning_rate": 3.263298398625106e-05, "epoch": 6.20731217356368, "step": 15450 }, { "loss": 5.535826086997986e-05, "grad_norm": 0.001610444625839591, "learning_rate": 3.2331378799449875e-05, "epoch": 6.227400562474889, "step": 15500 }, { "eval_seen_loss": 0.016191324219107628, "eval_seen_accuracy": 0.9972826086956522, "eval_seen_f1_valid": 0.9978788592976667, "eval_seen_f1_invalid": 0.9962200755984879, "eval_seen_macro_f1": 0.9970494674480773, "eval_seen_majority_baseline": 0.6400966183574879, "eval_seen_runtime": 0.3199, "eval_seen_samples_per_second": 20706.021, "eval_seen_steps_per_second": 162.547, "epoch": 6.227400562474889, "step": 15500 }, { "eval_unseen_loss": 0.08634968847036362, "eval_unseen_accuracy": 0.9841485507246377, "eval_unseen_f1_valid": 0.987560715555029, "eval_unseen_f1_invalid": 0.9781568545870605, "eval_unseen_macro_f1": 0.9828587850710447, "eval_unseen_majority_baseline": 0.6400966183574879, "eval_unseen_runtime": 0.3057, "eval_unseen_samples_per_second": 21665.898, "eval_unseen_steps_per_second": 170.083, "epoch": 6.227400562474889, "step": 15500 }, { "loss": 0.002557535767555237, "grad_norm": 0.0008218715083785355, "learning_rate": 3.203050646639496e-05, "epoch": 6.2474889513860985, "step": 15550 }, { "loss": 0.0009405004978179931, "grad_norm": 0.0009019052959047258, "learning_rate": 3.1730379466578266e-05, "epoch": 6.267577340297308, "step": 15600 }, { "loss": 0.0013148632645606994, "grad_norm": 0.0005091215716674924, "learning_rate": 3.143101024857708e-05, "epoch": 6.287665729208517, "step": 15650 }, { "loss": 0.0036501625180244447, "grad_norm": 0.002635682700201869, "learning_rate": 3.113241122953761e-05, "epoch": 6.3077541181197265, "step": 15700 }, { "loss": 0.0032262831926345827, "grad_norm": 0.0013482654467225075, "learning_rate": 3.0834594794659994e-05, "epoch": 6.327842507030936, "step": 15750 }, { "loss": 0.00024218712002038956, "grad_norm": 0.000721741293091327, "learning_rate": 3.053757329668457e-05, "epoch": 6.347930895942145, "step": 15800 }, { "loss": 3.9498805999755856e-05, "grad_norm": 0.00035534962080419064, "learning_rate": 3.024135905537956e-05, "epoch": 6.3680192848533546, "step": 15850 }, { "loss": 1.3891272246837615e-05, "grad_norm": 0.000355778553057462, "learning_rate": 2.9945964357029987e-05, "epoch": 6.388107673764564, "step": 15900 }, { "loss": 3.9079450070858e-05, "grad_norm": 0.07650864869356155, "learning_rate": 2.9651401453928163e-05, "epoch": 6.408196062675773, "step": 15950 }, { "loss": 0.00021860454231500625, "grad_norm": 0.0003715547500178218, "learning_rate": 2.9357682563865373e-05, "epoch": 6.428284451586983, "step": 16000 }, { "eval_seen_loss": 0.014586011879146099, "eval_seen_accuracy": 0.9978864734299517, "eval_seen_f1_valid": 0.9983494458854045, "eval_seen_f1_invalid": 0.9970625262274444, "eval_seen_macro_f1": 0.9977059860564245, "eval_seen_majority_baseline": 0.6400966183574879, "eval_seen_runtime": 0.3205, "eval_seen_samples_per_second": 20666.622, "eval_seen_steps_per_second": 162.238, "epoch": 6.428284451586983, "step": 16000 }, { "eval_unseen_loss": 0.06505319476127625, "eval_unseen_accuracy": 0.988677536231884, "eval_unseen_f1_valid": 0.9911650371068441, "eval_unseen_f1_invalid": 0.9842403866358479, "eval_unseen_macro_f1": 0.987702711871346, "eval_unseen_majority_baseline": 0.6400966183574879, "eval_unseen_runtime": 0.2959, "eval_unseen_samples_per_second": 22385.627, "eval_unseen_steps_per_second": 175.733, "epoch": 6.428284451586983, "step": 16000 }, { "loss": 1.775696873664856e-05, "grad_norm": 0.0004017347819171846, "learning_rate": 2.9064819869625314e-05, "epoch": 6.448372840498192, "step": 16050 }, { "loss": 0.00019178256392478942, "grad_norm": 0.0005201531457714736, "learning_rate": 2.8772825518478525e-05, "epoch": 6.468461229409401, "step": 16100 }, { "loss": 1.9734539091587066e-05, "grad_norm": 0.0006806280580349267, "learning_rate": 2.848171162167871e-05, "epoch": 6.488549618320611, "step": 16150 }, { "loss": 0.0001803133264183998, "grad_norm": 0.0003293660993222147, "learning_rate": 2.8191490253960375e-05, "epoch": 6.50863800723182, "step": 16200 }, { "loss": 1.029331237077713e-05, "grad_norm": 0.0003172715369146317, "learning_rate": 2.7902173453037982e-05, "epoch": 6.528726396143029, "step": 16250 }, { "loss": 0.0013763304054737091, "grad_norm": 3.6225039958953857, "learning_rate": 2.761377321910661e-05, "epoch": 6.548814785054239, "step": 16300 }, { "loss": 0.0025291353464126586, "grad_norm": 0.0003018236602656543, "learning_rate": 2.7326301514344256e-05, "epoch": 6.568903173965448, "step": 16350 }, { "loss": 0.002325804829597473, "grad_norm": 0.00033842388074845076, "learning_rate": 2.7039770262415655e-05, "epoch": 6.588991562876657, "step": 16400 }, { "loss": 0.0033012521266937256, "grad_norm": 0.0036098379641771317, "learning_rate": 2.6754191347977748e-05, "epoch": 6.609079951787867, "step": 16450 }, { "loss": 0.0001065874844789505, "grad_norm": 0.00032605676096864045, "learning_rate": 2.646957661618672e-05, "epoch": 6.629168340699076, "step": 16500 }, { "eval_seen_loss": 0.013449776917696, "eval_seen_accuracy": 0.9978864734299517, "eval_seen_f1_valid": 0.9983502238981853, "eval_seen_f1_invalid": 0.997060058798824, "eval_seen_macro_f1": 0.9977051413485046, "eval_seen_majority_baseline": 0.6400966183574879, "eval_seen_runtime": 0.3205, "eval_seen_samples_per_second": 20670.42, "eval_seen_steps_per_second": 162.268, "epoch": 6.629168340699076, "step": 16500 }, { "eval_unseen_loss": 0.06277448683977127, "eval_unseen_accuracy": 0.9898852657004831, "eval_unseen_f1_valid": 0.9921130076515596, "eval_unseen_f1_invalid": 0.985903639806438, "eval_unseen_macro_f1": 0.9890083237289988, "eval_unseen_majority_baseline": 0.6400966183574879, "eval_unseen_runtime": 0.3053, "eval_unseen_samples_per_second": 21694.422, "eval_unseen_steps_per_second": 170.306, "epoch": 6.629168340699076, "step": 16500 }, { "loss": 2.7056075632572176e-05, "grad_norm": 0.0002598020655568689, "learning_rate": 2.6185937872206645e-05, "epoch": 6.649256729610285, "step": 16550 }, { "loss": 1.0665915906429291e-05, "grad_norm": 0.00029112983611412346, "learning_rate": 2.5903286880719852e-05, "epoch": 6.669345118521495, "step": 16600 }, { "loss": 2.9137618839740752e-05, "grad_norm": 0.00034989695996046066, "learning_rate": 2.5621635365439034e-05, "epoch": 6.689433507432704, "step": 16650 }, { "loss": 0.0004712997749447823, "grad_norm": 0.00025116666802205145, "learning_rate": 2.534099500862085e-05, "epoch": 6.709521896343913, "step": 16700 }, { "loss": 1.5728212893009187e-05, "grad_norm": 0.0003110774850938469, "learning_rate": 2.506137745058148e-05, "epoch": 6.729610285255123, "step": 16750 }, { "loss": 0.0017288799583911895, "grad_norm": 0.002883067587390542, "learning_rate": 2.478279428921371e-05, "epoch": 6.749698674166332, "step": 16800 }, { "loss": 0.002549371421337128, "grad_norm": 0.00043419309076853096, "learning_rate": 2.4505257079506012e-05, "epoch": 6.769787063077541, "step": 16850 }, { "loss": 8.197244256734849e-05, "grad_norm": 0.0023284712806344032, "learning_rate": 2.422877733306309e-05, "epoch": 6.789875451988751, "step": 16900 }, { "loss": 3.0123256146907805e-05, "grad_norm": 0.006009037606418133, "learning_rate": 2.3953366517628607e-05, "epoch": 6.80996384089996, "step": 16950 }, { "loss": 0.001429406851530075, "grad_norm": 0.010161327198147774, "learning_rate": 2.367903605660934e-05, "epoch": 6.830052229811169, "step": 17000 }, { "eval_seen_loss": 0.01531138364225626, "eval_seen_accuracy": 0.9978864734299517, "eval_seen_f1_valid": 0.9983502238981853, "eval_seen_f1_invalid": 0.997060058798824, "eval_seen_macro_f1": 0.9977051413485046, "eval_seen_majority_baseline": 0.6400966183574879, "eval_seen_runtime": 0.3346, "eval_seen_samples_per_second": 19798.834, "eval_seen_steps_per_second": 155.426, "epoch": 6.830052229811169, "step": 17000 }, { "eval_unseen_loss": 0.09234398603439331, "eval_unseen_accuracy": 0.9865640096618358, "eval_unseen_f1_valid": 0.989488602810913, "eval_unseen_f1_invalid": 0.9813846475632713, "eval_unseen_macro_f1": 0.9854366251870921, "eval_unseen_majority_baseline": 0.6400966183574879, "eval_unseen_runtime": 0.3053, "eval_unseen_samples_per_second": 21698.031, "eval_unseen_steps_per_second": 170.335, "epoch": 6.830052229811169, "step": 17000 }, { "loss": 0.004940186142921448, "grad_norm": 0.0007521524094045162, "learning_rate": 2.340579732860152e-05, "epoch": 6.850140618722379, "step": 17050 }, { "loss": 2.277746796607971e-05, "grad_norm": 0.0003301052493043244, "learning_rate": 2.3133661666918765e-05, "epoch": 6.870229007633588, "step": 17100 }, { "loss": 3.1196326017379763e-05, "grad_norm": 0.00048009969759732485, "learning_rate": 2.2862640359122027e-05, "epoch": 6.8903173965447975, "step": 17150 }, { "loss": 1.5532001852989197e-05, "grad_norm": 0.0003433611709624529, "learning_rate": 2.259274464655147e-05, "epoch": 6.910405785456007, "step": 17200 }, { "loss": 0.0006354102492332459, "grad_norm": 0.0005477304221130908, "learning_rate": 2.2323985723860148e-05, "epoch": 6.930494174367215, "step": 17250 }, { "loss": 0.00010105263441801071, "grad_norm": 0.001819954952225089, "learning_rate": 2.2056374738549657e-05, "epoch": 6.9505825632784255, "step": 17300 }, { "loss": 0.0024885176122188568, "grad_norm": 0.00035599080729298294, "learning_rate": 2.1789922790507816e-05, "epoch": 6.970670952189634, "step": 17350 }, { "loss": 0.000506746768951416, "grad_norm": 0.002056804718449712, "learning_rate": 2.152464093154821e-05, "epoch": 6.990759341100844, "step": 17400 }, { "loss": 3.9716772735118864e-05, "grad_norm": 0.0003199533966835588, "learning_rate": 2.126054016495188e-05, "epoch": 7.010847730012053, "step": 17450 }, { "loss": 2.2945143282413483e-05, "grad_norm": 0.0002348485286347568, "learning_rate": 2.0997631445010858e-05, "epoch": 7.030936118923262, "step": 17500 }, { "eval_seen_loss": 0.01327558420598507, "eval_seen_accuracy": 0.9977355072463768, "eval_seen_f1_valid": 0.9982325910215624, "eval_seen_f1_invalid": 0.9968494013862634, "eval_seen_macro_f1": 0.9975409962039129, "eval_seen_majority_baseline": 0.6400966183574879, "eval_seen_runtime": 0.3251, "eval_seen_samples_per_second": 20376.02, "eval_seen_steps_per_second": 159.957, "epoch": 7.030936118923262, "step": 17500 }, { "eval_unseen_loss": 0.08052626252174377, "eval_unseen_accuracy": 0.9871678743961353, "eval_unseen_f1_valid": 0.9899752329284113, "eval_unseen_f1_invalid": 0.982176556930174, "eval_unseen_macro_f1": 0.9860758949292927, "eval_unseen_majority_baseline": 0.6400966183574879, "eval_unseen_runtime": 0.3089, "eval_unseen_samples_per_second": 21446.92, "eval_unseen_steps_per_second": 168.364, "epoch": 7.030936118923262, "step": 17500 }, { "loss": 1.6945749521255494e-05, "grad_norm": 0.00024341772950720042, "learning_rate": 2.0735925676573785e-05, "epoch": 7.051024507834471, "step": 17550 }, { "loss": 0.0011683499813079834, "grad_norm": 0.000335768359946087, "learning_rate": 2.047543371459366e-05, "epoch": 7.071112896745681, "step": 17600 }, { "loss": 0.004646786451339722, "grad_norm": 0.00035198635305278003, "learning_rate": 2.021616636367762e-05, "epoch": 7.09120128565689, "step": 17650 }, { "loss": 0.00020644064992666244, "grad_norm": 0.0004466926911845803, "learning_rate": 1.9958134377638687e-05, "epoch": 7.111289674568099, "step": 17700 }, { "loss": 6.792254745960235e-05, "grad_norm": 0.0007776455604471266, "learning_rate": 1.9701348459049874e-05, "epoch": 7.131378063479309, "step": 17750 }, { "loss": 0.0004381958022713661, "grad_norm": 0.0003025882178917527, "learning_rate": 1.944581925880009e-05, "epoch": 7.151466452390518, "step": 17800 }, { "loss": 6.515607237815857e-06, "grad_norm": 0.00025550602003932, "learning_rate": 1.9191557375652546e-05, "epoch": 7.171554841301727, "step": 17850 }, { "loss": 8.427612483501434e-06, "grad_norm": 0.00029596281819976866, "learning_rate": 1.893857335580499e-05, "epoch": 7.191643230212937, "step": 17900 }, { "loss": 9.106919169425964e-06, "grad_norm": 0.0002097087271977216, "learning_rate": 1.868687769245239e-05, "epoch": 7.211731619124146, "step": 17950 }, { "loss": 1.7725974321365355e-05, "grad_norm": 0.0005719594773836434, "learning_rate": 1.8436480825351605e-05, "epoch": 7.231820008035355, "step": 18000 }, { "eval_seen_loss": 0.014237217605113983, "eval_seen_accuracy": 0.9977355072463768, "eval_seen_f1_valid": 0.998231340643792, "eval_seen_f1_invalid": 0.9968533668974197, "eval_seen_macro_f1": 0.9975423537706058, "eval_seen_majority_baseline": 0.6400966183574879, "eval_seen_runtime": 0.3163, "eval_seen_samples_per_second": 20941.881, "eval_seen_steps_per_second": 164.399, "epoch": 7.231820008035355, "step": 18000 }, { "eval_unseen_loss": 0.05696876347064972, "eval_unseen_accuracy": 0.9909420289855072, "eval_unseen_f1_valid": 0.9929245283018868, "eval_unseen_f1_invalid": 0.9874161073825504, "eval_unseen_macro_f1": 0.9901703178422185, "eval_unseen_majority_baseline": 0.6400966183574879, "eval_unseen_runtime": 0.3145, "eval_unseen_samples_per_second": 21061.294, "eval_unseen_steps_per_second": 165.336, "epoch": 7.231820008035355, "step": 18000 }, { "loss": 6.993412971496582e-06, "grad_norm": 0.0002458687813486904, "learning_rate": 1.818739314038847e-05, "epoch": 7.251908396946565, "step": 18050 }, { "loss": 0.0008838069438934326, "grad_norm": 0.0003040506271645427, "learning_rate": 1.793962496914691e-05, "epoch": 7.271996785857774, "step": 18100 }, { "loss": 0.00013988766819238662, "grad_norm": 0.0010905415983870625, "learning_rate": 1.769318658848046e-05, "epoch": 7.292085174768983, "step": 18150 }, { "loss": 4.3235272169113156e-05, "grad_norm": 0.0003398769476916641, "learning_rate": 1.7448088220086028e-05, "epoch": 7.312173563680193, "step": 18200 }, { "loss": 5.77002763748169e-06, "grad_norm": 0.000229157623834908, "learning_rate": 1.7204340030079912e-05, "epoch": 7.332261952591402, "step": 18250 }, { "loss": 6.55684620141983e-06, "grad_norm": 0.00021728631691075861, "learning_rate": 1.6961952128576064e-05, "epoch": 7.3523503415026115, "step": 18300 }, { "loss": 1.53171643614769e-05, "grad_norm": 0.00021770535386167467, "learning_rate": 1.6720934569266826e-05, "epoch": 7.372438730413821, "step": 18350 }, { "loss": 0.00031239636242389677, "grad_norm": 0.0006413852097466588, "learning_rate": 1.64812973490059e-05, "epoch": 7.39252711932503, "step": 18400 }, { "loss": 9.444206953048706e-06, "grad_norm": 0.00024652466527186334, "learning_rate": 1.6243050407393696e-05, "epoch": 7.4126155082362395, "step": 18450 }, { "loss": 3.102324903011322e-05, "grad_norm": 0.001528206979855895, "learning_rate": 1.6006203626365097e-05, "epoch": 7.432703897147449, "step": 18500 }, { "eval_seen_loss": 0.011784316040575504, "eval_seen_accuracy": 0.9980374396135265, "eval_seen_f1_valid": 0.9984678845020625, "eval_seen_f1_invalid": 0.9972706277556163, "eval_seen_macro_f1": 0.9978692561288394, "eval_seen_majority_baseline": 0.6400966183574879, "eval_seen_runtime": 0.3094, "eval_seen_samples_per_second": 21407.771, "eval_seen_steps_per_second": 168.056, "epoch": 7.432703897147449, "step": 18500 }, { "eval_unseen_loss": 0.04249073192477226, "eval_unseen_accuracy": 0.9936594202898551, "eval_unseen_f1_valid": 0.9950541686292981, "eval_unseen_f1_invalid": 0.9911690496215307, "eval_unseen_macro_f1": 0.9931116091254144, "eval_unseen_majority_baseline": 0.6400966183574879, "eval_unseen_runtime": 0.3055, "eval_unseen_samples_per_second": 21685.396, "eval_unseen_steps_per_second": 170.236, "epoch": 7.432703897147449, "step": 18500 }, { "loss": 5.453340709209442e-06, "grad_norm": 0.00019290638738311827, "learning_rate": 1.5770766829779498e-05, "epoch": 7.452792286058658, "step": 18550 }, { "loss": 1.5767738223075866e-05, "grad_norm": 0.0003964620118495077, "learning_rate": 1.5536749783013398e-05, "epoch": 7.4728806749698675, "step": 18600 }, { "loss": 2.11561843752861e-05, "grad_norm": 0.0002844040864147246, "learning_rate": 1.530416219255536e-05, "epoch": 7.492969063881077, "step": 18650 }, { "loss": 7.1339309215545654e-06, "grad_norm": 0.0002172449603676796, "learning_rate": 1.50730137056034e-05, "epoch": 7.513057452792286, "step": 18700 }, { "loss": 6.715469062328339e-06, "grad_norm": 0.00025726479361765087, "learning_rate": 1.4843313909664786e-05, "epoch": 7.5331458417034955, "step": 18750 }, { "loss": 1.2444481253623962e-05, "grad_norm": 0.0002705488004721701, "learning_rate": 1.4615072332158424e-05, "epoch": 7.553234230614705, "step": 18800 }, { "loss": 5.9470906853675845e-06, "grad_norm": 0.01123479101806879, "learning_rate": 1.4388298440019732e-05, "epoch": 7.573322619525914, "step": 18850 }, { "loss": 0.0002536303177475929, "grad_norm": 0.00019734656962100416, "learning_rate": 1.4163001639307843e-05, "epoch": 7.593411008437124, "step": 18900 }, { "loss": 2.517692744731903e-05, "grad_norm": 0.0017155244713649154, "learning_rate": 1.39391912748156e-05, "epoch": 7.613499397348333, "step": 18950 }, { "loss": 5.56260347366333e-06, "grad_norm": 0.0002527149044908583, "learning_rate": 1.371687662968183e-05, "epoch": 7.633587786259542, "step": 19000 }, { "eval_seen_loss": 0.011350261978805065, "eval_seen_accuracy": 0.9978864734299517, "eval_seen_f1_valid": 0.9983494458854045, "eval_seen_f1_invalid": 0.9970625262274444, "eval_seen_macro_f1": 0.9977059860564245, "eval_seen_majority_baseline": 0.6400966183574879, "eval_seen_runtime": 0.3144, "eval_seen_samples_per_second": 21067.587, "eval_seen_steps_per_second": 165.386, "epoch": 7.633587786259542, "step": 19000 }, { "eval_unseen_loss": 0.045558616518974304, "eval_unseen_accuracy": 0.9941123188405797, "eval_unseen_f1_valid": 0.9954112248499823, "eval_unseen_f1_invalid": 0.9917877447883765, "eval_unseen_macro_f1": 0.9935994848191794, "eval_unseen_majority_baseline": 0.6400966183574879, "eval_unseen_runtime": 0.305, "eval_unseen_samples_per_second": 21718.385, "eval_unseen_steps_per_second": 170.495, "epoch": 7.633587786259542, "step": 19000 }, { "loss": 1.60391628742218e-05, "grad_norm": 0.00019333165255375206, "learning_rate": 1.3496066925006435e-05, "epoch": 7.653676175170752, "step": 19050 }, { "loss": 1.3582371175289153e-05, "grad_norm": 0.000267647992586717, "learning_rate": 1.3276771319467785e-05, "epoch": 7.673764564081961, "step": 19100 }, { "loss": 7.217995822429657e-05, "grad_norm": 0.0003133589925710112, "learning_rate": 1.3058998908942922e-05, "epoch": 7.69385295299317, "step": 19150 }, { "loss": 1.6851797699928283e-05, "grad_norm": 0.010939225554466248, "learning_rate": 1.2842758726130283e-05, "epoch": 7.71394134190438, "step": 19200 }, { "loss": 4.377402365207672e-06, "grad_norm": 0.0005316520691849291, "learning_rate": 1.2628059740175024e-05, "epoch": 7.734029730815589, "step": 19250 }, { "loss": 0.00048248179256916047, "grad_norm": 0.0003787012828979641, "learning_rate": 1.2414910856296985e-05, "epoch": 7.754118119726797, "step": 19300 }, { "loss": 4.041831940412521e-05, "grad_norm": 0.00018383558199275285, "learning_rate": 1.2203320915421346e-05, "epoch": 7.774206508638008, "step": 19350 }, { "loss": 4.867933690547943e-05, "grad_norm": 0.0001739686558721587, "learning_rate": 1.1993298693811877e-05, "epoch": 7.794294897549216, "step": 19400 }, { "loss": 1.4136731624603272e-05, "grad_norm": 0.00019290608179289848, "learning_rate": 1.1784852902707073e-05, "epoch": 7.814383286460426, "step": 19450 }, { "loss": 4.587210714817047e-06, "grad_norm": 0.0001746905327308923, "learning_rate": 1.1577992187958615e-05, "epoch": 7.834471675371635, "step": 19500 }, { "eval_seen_loss": 0.012746668420732021, "eval_seen_accuracy": 0.9981884057971014, "eval_seen_f1_valid": 0.9985859061984445, "eval_seen_f1_invalid": 0.997480050398992, "eval_seen_macro_f1": 0.9980329782987183, "eval_seen_majority_baseline": 0.6400966183574879, "eval_seen_runtime": 0.3302, "eval_seen_samples_per_second": 20059.703, "eval_seen_steps_per_second": 157.474, "epoch": 7.834471675371635, "step": 19500 }, { "eval_unseen_loss": 0.04527498781681061, "eval_unseen_accuracy": 0.9933574879227053, "eval_unseen_f1_valid": 0.9948259642521167, "eval_unseen_f1_invalid": 0.990725126475548, "eval_unseen_macro_f1": 0.9927755453638323, "eval_unseen_majority_baseline": 0.6400966183574879, "eval_unseen_runtime": 0.3108, "eval_unseen_samples_per_second": 21311.347, "eval_unseen_steps_per_second": 167.299, "epoch": 7.834471675371635, "step": 19500 }, { "loss": 0.00014036081731319427, "grad_norm": 0.00023242826864589006, "learning_rate": 1.1372725129672896e-05, "epoch": 7.854560064282844, "step": 19550 }, { "loss": 5.762390792369842e-06, "grad_norm": 0.00019600246741902083, "learning_rate": 1.1169060241855095e-05, "epoch": 7.8746484531940535, "step": 19600 }, { "loss": 4.053488373756408e-06, "grad_norm": 0.00014491379261016846, "learning_rate": 1.0967005972056083e-05, "epoch": 7.894736842105263, "step": 19650 }, { "loss": 4.891790449619294e-06, "grad_norm": 0.0002486503799445927, "learning_rate": 1.0766570701021983e-05, "epoch": 7.914825231016472, "step": 19700 }, { "loss": 3.816671669483185e-06, "grad_norm": 0.00015516391431447119, "learning_rate": 1.056776274234656e-05, "epoch": 7.9349136199276815, "step": 19750 }, { "loss": 3.6293640732765198e-06, "grad_norm": 0.00014282570919021964, "learning_rate": 1.0370590342126412e-05, "epoch": 7.955002008838891, "step": 19800 }, { "loss": 4.312135279178619e-06, "grad_norm": 0.00013145770935807377, "learning_rate": 1.0175061678618969e-05, "epoch": 7.9750903977501, "step": 19850 }, { "loss": 1.159965991973877e-05, "grad_norm": 0.00013499190390575677, "learning_rate": 9.981184861903186e-06, "epoch": 7.9951787866613095, "step": 19900 }, { "loss": 3.3606216311454773e-06, "grad_norm": 0.00018055748660117388, "learning_rate": 9.78896793354328e-06, "epoch": 8.01526717557252, "step": 19950 }, { "loss": 5.6288763880729676e-06, "grad_norm": 0.00015812755736988038, "learning_rate": 9.59841886625506e-06, "epoch": 8.035355564483728, "step": 20000 }, { "eval_seen_loss": 0.011836923658847809, "eval_seen_accuracy": 0.9978864734299517, "eval_seen_f1_valid": 0.9983498349834984, "eval_seen_f1_invalid": 0.9970612930310664, "eval_seen_macro_f1": 0.9977055640072824, "eval_seen_majority_baseline": 0.6400966183574879, "eval_seen_runtime": 0.3249, "eval_seen_samples_per_second": 20390.795, "eval_seen_steps_per_second": 160.073, "epoch": 8.035355564483728, "step": 20000 }, { "eval_unseen_loss": 0.04228868708014488, "eval_unseen_accuracy": 0.9947161835748792, "eval_unseen_f1_valid": 0.9958808991408732, "eval_unseen_f1_invalid": 0.9926331298673964, "eval_unseen_macro_f1": 0.9942570145041347, "eval_unseen_majority_baseline": 0.6400966183574879, "eval_unseen_runtime": 0.3069, "eval_unseen_samples_per_second": 21586.008, "eval_unseen_steps_per_second": 169.455, "epoch": 8.035355564483728, "step": 20000 }, { "loss": 3.6133453249931337e-06, "grad_norm": 0.0002495869412086904, "learning_rate": 9.40954556357535e-06, "epoch": 8.055443953394938, "step": 20050 }, { "loss": 3.3559650182724e-06, "grad_norm": 0.00026279842131771147, "learning_rate": 9.222355859534071e-06, "epoch": 8.075532342306147, "step": 20100 }, { "loss": 3.551878035068512e-06, "grad_norm": 0.0001303624449064955, "learning_rate": 9.036857518329356e-06, "epoch": 8.095620731217357, "step": 20150 }, { "loss": 3.4165382385253906e-06, "grad_norm": 0.00014572461077477783, "learning_rate": 8.853058234005512e-06, "epoch": 8.115709120128566, "step": 20200 }, { "loss": 0.0004174730554223061, "grad_norm": 0.6496160626411438, "learning_rate": 8.670965630133893e-06, "epoch": 8.135797509039776, "step": 20250 }, { "loss": 6.2954053282737735e-06, "grad_norm": 0.0005189924850128591, "learning_rate": 8.490587259496635e-06, "epoch": 8.155885897950984, "step": 20300 }, { "loss": 0.00034780647605657576, "grad_norm": 0.00014101318083703518, "learning_rate": 8.311930603773438e-06, "epoch": 8.175974286862195, "step": 20350 }, { "loss": 9.302161633968354e-06, "grad_norm": 0.00019721974967978895, "learning_rate": 8.135003073231246e-06, "epoch": 8.196062675773403, "step": 20400 }, { "loss": 1.5042945742607116e-05, "grad_norm": 0.00016112760931719095, "learning_rate": 7.959812006416861e-06, "epoch": 8.216151064684611, "step": 20450 }, { "loss": 3.8015469908714295e-06, "grad_norm": 0.0003184220695402473, "learning_rate": 7.78636466985257e-06, "epoch": 8.236239453595822, "step": 20500 }, { "eval_seen_loss": 0.012019069865345955, "eval_seen_accuracy": 0.9978864734299517, "eval_seen_f1_valid": 0.9983498349834984, "eval_seen_f1_invalid": 0.9970612930310664, "eval_seen_macro_f1": 0.9977055640072824, "eval_seen_majority_baseline": 0.6400966183574879, "eval_seen_runtime": 0.3216, "eval_seen_samples_per_second": 20600.148, "eval_seen_steps_per_second": 161.716, "epoch": 8.236239453595822, "step": 20500 }, { "eval_unseen_loss": 0.03911798819899559, "eval_unseen_accuracy": 0.9945652173913043, "eval_unseen_f1_valid": 0.9957627118644068, "eval_unseen_f1_invalid": 0.9924242424242424, "eval_unseen_macro_f1": 0.9940934771443246, "eval_unseen_majority_baseline": 0.6400966183574879, "eval_unseen_runtime": 0.3311, "eval_unseen_samples_per_second": 20004.327, "eval_unseen_steps_per_second": 157.039, "epoch": 8.236239453595822, "step": 20500 }, { "loss": 4.818551242351532e-06, "grad_norm": 0.00016147899441421032, "learning_rate": 7.614668257734719e-06, "epoch": 8.25632784250703, "step": 20550 }, { "loss": 7.018953561782837e-05, "grad_norm": 0.00044564157724380493, "learning_rate": 7.444729891635349e-06, "epoch": 8.27641623141824, "step": 20600 }, { "loss": 3.513358533382416e-06, "grad_norm": 0.00014842434029560536, "learning_rate": 7.2765566202068206e-06, "epoch": 8.296504620329449, "step": 20650 }, { "loss": 3.3337250351905822e-06, "grad_norm": 0.00013708991173189133, "learning_rate": 7.110155418889419e-06, "epoch": 8.316593009240659, "step": 20700 }, { "loss": 1.0120011866092682e-05, "grad_norm": 0.0001332744723185897, "learning_rate": 6.945533189622022e-06, "epoch": 8.336681398151867, "step": 20750 }, { "loss": 3.4270063042640684e-06, "grad_norm": 0.00013819074956700206, "learning_rate": 6.7826967605558344e-06, "epoch": 8.356769787063078, "step": 20800 }, { "loss": 1.0085813701152801e-05, "grad_norm": 0.00014096000813879073, "learning_rate": 6.621652885771229e-06, "epoch": 8.376858175974286, "step": 20850 }, { "loss": 3.064647316932678e-06, "grad_norm": 0.00014031221508048475, "learning_rate": 6.462408244997486e-06, "epoch": 8.396946564885496, "step": 20900 }, { "loss": 3.0971691012382507e-06, "grad_norm": 0.00013209764438215643, "learning_rate": 6.304969443335862e-06, "epoch": 8.417034953796705, "step": 20950 }, { "loss": 3.0650943517684936e-06, "grad_norm": 0.00014701248437631875, "learning_rate": 6.149343010985503e-06, "epoch": 8.437123342707915, "step": 21000 }, { "eval_seen_loss": 0.012507510371506214, "eval_seen_accuracy": 0.9981884057971014, "eval_seen_f1_valid": 0.9985859061984445, "eval_seen_f1_invalid": 0.997480050398992, "eval_seen_macro_f1": 0.9980329782987183, "eval_seen_majority_baseline": 0.6400966183574879, "eval_seen_runtime": 0.3268, "eval_seen_samples_per_second": 20271.593, "eval_seen_steps_per_second": 159.137, "epoch": 8.437123342707915, "step": 21000 }, { "eval_unseen_loss": 0.03895845264196396, "eval_unseen_accuracy": 0.9942632850241546, "eval_unseen_f1_valid": 0.9955283596140269, "eval_unseen_f1_invalid": 0.992, "eval_unseen_macro_f1": 0.9937641798070134, "eval_unseen_majority_baseline": 0.6400966183574879, "eval_unseen_runtime": 0.3107, "eval_unseen_samples_per_second": 21317.822, "eval_unseen_steps_per_second": 167.35, "epoch": 8.437123342707915, "step": 21000 }, { "loss": 3.073066473007202e-06, "grad_norm": 0.00013140306691639125, "learning_rate": 5.995535402972702e-06, "epoch": 8.457211731619124, "step": 21050 }, { "loss": 4.372160881757736e-05, "grad_norm": 0.00014569831546396017, "learning_rate": 5.843552998883073e-06, "epoch": 8.477300120530334, "step": 21100 }, { "loss": 3.0318647623062134e-06, "grad_norm": 0.00016386796778533608, "learning_rate": 5.693402102596962e-06, "epoch": 8.497388509441542, "step": 21150 }, { "loss": 4.044137895107269e-06, "grad_norm": 0.0001544577971799299, "learning_rate": 5.545088942028009e-06, "epoch": 8.517476898352752, "step": 21200 }, { "loss": 3.307312726974487e-06, "grad_norm": 0.0002282865607412532, "learning_rate": 5.398619668864818e-06, "epoch": 8.537565287263961, "step": 21250 }, { "loss": 3.1630322337150576e-06, "grad_norm": 0.00012746526044793427, "learning_rate": 5.2540003583157525e-06, "epoch": 8.557653676175171, "step": 21300 }, { "loss": 2.9011070728302e-06, "grad_norm": 0.00010656457743607461, "learning_rate": 5.111237008856984e-06, "epoch": 8.57774206508638, "step": 21350 }, { "loss": 3.054514527320862e-06, "grad_norm": 0.00010875113366637379, "learning_rate": 4.970335541983723e-06, "epoch": 8.59783045399759, "step": 21400 }, { "loss": 3.0556321144104004e-06, "grad_norm": 0.0001811092661228031, "learning_rate": 4.831301801964555e-06, "epoch": 8.617918842908798, "step": 21450 }, { "loss": 3.187432885169983e-06, "grad_norm": 0.00012966326903551817, "learning_rate": 4.694141555599058e-06, "epoch": 8.638007231820009, "step": 21500 }, { "eval_seen_loss": 0.012946849688887596, "eval_seen_accuracy": 0.9981884057971014, "eval_seen_f1_valid": 0.9985859061984445, "eval_seen_f1_invalid": 0.997480050398992, "eval_seen_macro_f1": 0.9980329782987183, "eval_seen_majority_baseline": 0.6400966183574879, "eval_seen_runtime": 0.3132, "eval_seen_samples_per_second": 21146.93, "eval_seen_steps_per_second": 166.009, "epoch": 8.638007231820009, "step": 21500 }, { "eval_unseen_loss": 0.04752921685576439, "eval_unseen_accuracy": 0.9930555555555556, "eval_unseen_f1_valid": 0.9945920526687044, "eval_unseen_f1_invalid": 0.9902994517081402, "eval_unseen_macro_f1": 0.9924457521884222, "eval_unseen_majority_baseline": 0.6400966183574879, "eval_unseen_runtime": 0.3071, "eval_unseen_samples_per_second": 21566.403, "eval_unseen_steps_per_second": 169.301, "epoch": 8.638007231820009, "step": 21500 }, { "loss": 3.5515427589416504e-06, "grad_norm": 0.00013049629342276603, "learning_rate": 4.5588604919785895e-06, "epoch": 8.658095620731217, "step": 21550 }, { "loss": 2.780258655548096e-06, "grad_norm": 0.0001262566656805575, "learning_rate": 4.425464222250348e-06, "epoch": 8.678184009642427, "step": 21600 }, { "loss": 4.116110503673554e-06, "grad_norm": 0.000128673724248074, "learning_rate": 4.293958279384608e-06, "epoch": 8.698272398553636, "step": 21650 }, { "loss": 8.174490183591842e-05, "grad_norm": 0.0005245626671239734, "learning_rate": 4.16434811794526e-06, "epoch": 8.718360787464846, "step": 21700 }, { "loss": 7.002241909503937e-06, "grad_norm": 0.00013448468234855682, "learning_rate": 4.036639113863522e-06, "epoch": 8.738449176376054, "step": 21750 }, { "loss": 2.822093665599823e-06, "grad_norm": 0.00012475447147153318, "learning_rate": 3.910836564214965e-06, "epoch": 8.758537565287265, "step": 21800 }, { "loss": 2.5692582130432127e-06, "grad_norm": 0.00011487610754556954, "learning_rate": 3.7869456869998597e-06, "epoch": 8.778625954198473, "step": 21850 }, { "loss": 2.6272982358932495e-06, "grad_norm": 0.00014223760808818042, "learning_rate": 3.664971620926666e-06, "epoch": 8.798714343109683, "step": 21900 }, { "loss": 2.6938319206237793e-06, "grad_norm": 0.00010725839820224792, "learning_rate": 3.5449194251989505e-06, "epoch": 8.818802732020892, "step": 21950 }, { "loss": 1.2151449918746949e-05, "grad_norm": 0.0001417612365912646, "learning_rate": 3.4267940793055063e-06, "epoch": 8.838891120932102, "step": 22000 }, { "eval_seen_loss": 0.012583291158080101, "eval_seen_accuracy": 0.9980374396135265, "eval_seen_f1_valid": 0.9984678845020625, "eval_seen_f1_invalid": 0.9972706277556163, "eval_seen_macro_f1": 0.9978692561288394, "eval_seen_majority_baseline": 0.6400966183574879, "eval_seen_runtime": 0.3161, "eval_seen_samples_per_second": 20954.738, "eval_seen_steps_per_second": 164.5, "epoch": 8.838891120932102, "step": 22000 }, { "eval_unseen_loss": 0.04813293740153313, "eval_unseen_accuracy": 0.9936594202898551, "eval_unseen_f1_valid": 0.9950599858856739, "eval_unseen_f1_invalid": 0.9911504424778761, "eval_unseen_macro_f1": 0.993105214181775, "eval_unseen_majority_baseline": 0.6400966183574879, "eval_unseen_runtime": 0.3177, "eval_unseen_samples_per_second": 20849.332, "eval_unseen_steps_per_second": 163.672, "epoch": 8.838891120932102, "step": 22000 }, { "loss": 6.3090398907661436e-06, "grad_norm": 0.00020181726722512394, "learning_rate": 3.3106004828138525e-06, "epoch": 8.85897950984331, "step": 22050 }, { "loss": 2.9055774211883546e-06, "grad_norm": 0.00015510858793277293, "learning_rate": 3.19634345516695e-06, "epoch": 8.87906789875452, "step": 22100 }, { "loss": 2.4076923727989195e-06, "grad_norm": 0.00020350102568045259, "learning_rate": 3.0840277354833856e-06, "epoch": 8.899156287665729, "step": 22150 }, { "loss": 2.4836510419845583e-06, "grad_norm": 0.00012597607565112412, "learning_rate": 2.9736579823607224e-06, "epoch": 8.91924467657694, "step": 22200 }, { "loss": 2.3871287703514098e-06, "grad_norm": 0.00016495909949298948, "learning_rate": 2.8652387736823385e-06, "epoch": 8.939333065488148, "step": 22250 }, { "loss": 4.006139934062958e-06, "grad_norm": 0.0001801540347514674, "learning_rate": 2.758774606427489e-06, "epoch": 8.959421454399358, "step": 22300 }, { "loss": 4.346966743469239e-06, "grad_norm": 0.00020672632672358304, "learning_rate": 2.6542698964848232e-06, "epoch": 8.979509843310566, "step": 22350 }, { "loss": 2.60915607213974e-06, "grad_norm": 0.000188817095477134, "learning_rate": 2.55172897846922e-06, "epoch": 8.999598232221775, "step": 22400 }, { "loss": 2.6184692978858947e-06, "grad_norm": 0.0001020833442453295, "learning_rate": 2.45115610554198e-06, "epoch": 9.019686621132985, "step": 22450 }, { "loss": 3.1993165612220762e-06, "grad_norm": 0.00011981981515418738, "learning_rate": 2.3525554492344115e-06, "epoch": 9.039775010044194, "step": 22500 }, { "eval_seen_loss": 0.012907730415463448, "eval_seen_accuracy": 0.9980374396135265, "eval_seen_f1_valid": 0.9984678845020625, "eval_seen_f1_invalid": 0.9972706277556163, "eval_seen_macro_f1": 0.9978692561288394, "eval_seen_majority_baseline": 0.6400966183574879, "eval_seen_runtime": 0.3224, "eval_seen_samples_per_second": 20544.851, "eval_seen_steps_per_second": 161.282, "epoch": 9.039775010044194, "step": 22500 }, { "eval_unseen_loss": 0.048420634120702744, "eval_unseen_accuracy": 0.9935084541062802, "eval_unseen_f1_valid": 0.9949429613077737, "eval_unseen_f1_invalid": 0.9909378292939937, "eval_unseen_macro_f1": 0.9929403953008837, "eval_unseen_majority_baseline": 0.6400966183574879, "eval_unseen_runtime": 0.3203, "eval_unseen_samples_per_second": 20678.404, "eval_unseen_steps_per_second": 162.33, "epoch": 9.039775010044194, "step": 22500 }, { "loss": 3.539063036441803e-06, "grad_norm": 0.00010783238394651562, "learning_rate": 2.255931099274838e-06, "epoch": 9.059863398955404, "step": 22550 }, { "loss": 5.3878501057624816e-06, "grad_norm": 0.0001741989835863933, "learning_rate": 2.161287063418921e-06, "epoch": 9.079951787866612, "step": 22600 }, { "loss": 6.289780139923096e-06, "grad_norm": 0.0006154667935334146, "learning_rate": 2.068627267283463e-06, "epoch": 9.100040176777823, "step": 22650 }, { "loss": 2.5946274399757386e-06, "grad_norm": 0.0003669976722449064, "learning_rate": 1.9779555541835803e-06, "epoch": 9.120128565689031, "step": 22700 }, { "loss": 2.5730207562446596e-06, "grad_norm": 0.0001609391183592379, "learning_rate": 1.8892756849732628e-06, "epoch": 9.140216954600241, "step": 22750 }, { "loss": 5.313083529472351e-06, "grad_norm": 0.0004570932942442596, "learning_rate": 1.8025913378893921e-06, "epoch": 9.16030534351145, "step": 22800 }, { "loss": 2.6881694793701173e-06, "grad_norm": 0.00011044947314076126, "learning_rate": 1.7179061083992143e-06, "epoch": 9.18039373242266, "step": 22850 }, { "loss": 6.092563271522522e-06, "grad_norm": 0.00014000650844536722, "learning_rate": 1.6352235090511482e-06, "epoch": 9.200482121333868, "step": 22900 }, { "loss": 2.402588725090027e-06, "grad_norm": 0.00012029660138068721, "learning_rate": 1.5545469693291404e-06, "epoch": 9.220570510245079, "step": 22950 }, { "loss": 2.5689974427223206e-06, "grad_norm": 0.0001026357349473983, "learning_rate": 1.4758798355103964e-06, "epoch": 9.240658899156287, "step": 23000 }, { "eval_seen_loss": 0.012925754301249981, "eval_seen_accuracy": 0.9980374396135265, "eval_seen_f1_valid": 0.9984678845020625, "eval_seen_f1_invalid": 0.9972706277556163, "eval_seen_macro_f1": 0.9978692561288394, "eval_seen_majority_baseline": 0.6400966183574879, "eval_seen_runtime": 0.3111, "eval_seen_samples_per_second": 21289.562, "eval_seen_steps_per_second": 167.128, "epoch": 9.240658899156287, "step": 23000 }, { "eval_unseen_loss": 0.0486987829208374, "eval_unseen_accuracy": 0.9935084541062802, "eval_unseen_f1_valid": 0.9949429613077737, "eval_unseen_f1_invalid": 0.9909378292939937, "eval_unseen_macro_f1": 0.9929403953008837, "eval_unseen_majority_baseline": 0.6400966183574879, "eval_unseen_runtime": 0.3047, "eval_unseen_samples_per_second": 21736.906, "eval_unseen_steps_per_second": 170.64, "epoch": 9.240658899156287, "step": 23000 }, { "loss": 7.318779826164245e-06, "grad_norm": 9.652505832491443e-05, "learning_rate": 1.3992253705265913e-06, "epoch": 9.260747288067497, "step": 23050 }, { "loss": 1.061670482158661e-05, "grad_norm": 0.00011741998605430126, "learning_rate": 1.3245867538285218e-06, "epoch": 9.280835676978706, "step": 23100 }, { "loss": 2.544894814491272e-06, "grad_norm": 0.00011236020509386435, "learning_rate": 1.2519670812542462e-06, "epoch": 9.300924065889916, "step": 23150 }, { "loss": 2.25018709897995e-06, "grad_norm": 0.00014098426618147641, "learning_rate": 1.181369364900653e-06, "epoch": 9.321012454801124, "step": 23200 }, { "loss": 2.422593533992767e-06, "grad_norm": 0.0002591471129562706, "learning_rate": 1.1127965329985613e-06, "epoch": 9.341100843712335, "step": 23250 }, { "loss": 4.821904003620147e-06, "grad_norm": 0.00010918612679233775, "learning_rate": 1.046251429791223e-06, "epoch": 9.361189232623543, "step": 23300 }, { "loss": 2.5689974427223206e-06, "grad_norm": 9.60305769694969e-05, "learning_rate": 9.817368154163731e-07, "epoch": 9.381277621534753, "step": 23350 }, { "loss": 2.3266300559043883e-06, "grad_norm": 0.00010005357034970075, "learning_rate": 9.192553657917491e-07, "epoch": 9.401366010445962, "step": 23400 }, { "loss": 2.2694468498229982e-06, "grad_norm": 0.00019680566038005054, "learning_rate": 8.588096725041017e-07, "epoch": 9.421454399357172, "step": 23450 }, { "loss": 2.3963674902915954e-06, "grad_norm": 0.00012088896619388834, "learning_rate": 8.004022427016755e-07, "epoch": 9.44154278826838, "step": 23500 }, { "eval_seen_loss": 0.01295688096433878, "eval_seen_accuracy": 0.9980374396135265, "eval_seen_f1_valid": 0.9984678845020625, "eval_seen_f1_invalid": 0.9972706277556163, "eval_seen_macro_f1": 0.9978692561288394, "eval_seen_majority_baseline": 0.6400966183574879, "eval_seen_runtime": 0.3169, "eval_seen_samples_per_second": 20904.426, "eval_seen_steps_per_second": 164.105, "epoch": 9.44154278826838, "step": 23500 }, { "eval_unseen_loss": 0.04889357462525368, "eval_unseen_accuracy": 0.9935084541062802, "eval_unseen_f1_valid": 0.9949429613077737, "eval_unseen_f1_invalid": 0.9909378292939937, "eval_unseen_macro_f1": 0.9929403953008837, "eval_unseen_majority_baseline": 0.6400966183574879, "eval_unseen_runtime": 0.3124, "eval_unseen_samples_per_second": 21200.326, "eval_unseen_steps_per_second": 166.428, "epoch": 9.44154278826838, "step": 23500 }, { "loss": 2.274066209793091e-06, "grad_norm": 0.00013658883108291775, "learning_rate": 7.440354989902476e-07, "epoch": 9.46163117717959, "step": 23550 }, { "loss": 2.394132316112518e-06, "grad_norm": 9.553777636028826e-05, "learning_rate": 6.897117793326246e-07, "epoch": 9.4817195660908, "step": 23600 }, { "loss": 2.231821417808533e-06, "grad_norm": 9.738129301695153e-05, "learning_rate": 6.374333369516816e-07, "epoch": 9.50180795500201, "step": 23650 }, { "loss": 2.571381628513336e-06, "grad_norm": 0.00044456496834754944, "learning_rate": 5.872023402369086e-07, "epoch": 9.521896343913218, "step": 23700 }, { "loss": 9.307749569416047e-06, "grad_norm": 0.00010363019828218967, "learning_rate": 5.390208726544388e-07, "epoch": 9.541984732824428, "step": 23750 }, { "loss": 2.765655517578125e-06, "grad_norm": 0.0001128022704506293, "learning_rate": 4.928909326606779e-07, "epoch": 9.562073121735637, "step": 23800 }, { "loss": 4.050321877002716e-06, "grad_norm": 0.00010679530532797799, "learning_rate": 4.4881443361936557e-07, "epoch": 9.582161510646847, "step": 23850 }, { "loss": 2.3236870765686035e-06, "grad_norm": 0.00013532352750189602, "learning_rate": 4.0679320372226105e-07, "epoch": 9.602249899558055, "step": 23900 }, { "loss": 2.273358404636383e-06, "grad_norm": 0.00011449832527432591, "learning_rate": 3.668289859132701e-07, "epoch": 9.622338288469265, "step": 23950 }, { "loss": 2.487748861312866e-06, "grad_norm": 0.00010196401854045689, "learning_rate": 3.289234378161754e-07, "epoch": 9.642426677380474, "step": 24000 }, { "eval_seen_loss": 0.012985438108444214, "eval_seen_accuracy": 0.9980374396135265, "eval_seen_f1_valid": 0.9984678845020625, "eval_seen_f1_invalid": 0.9972706277556163, "eval_seen_macro_f1": 0.9978692561288394, "eval_seen_majority_baseline": 0.6400966183574879, "eval_seen_runtime": 0.315, "eval_seen_samples_per_second": 21031.688, "eval_seen_steps_per_second": 165.104, "epoch": 9.642426677380474, "step": 24000 }, { "eval_unseen_loss": 0.049161944538354874, "eval_unseen_accuracy": 0.9935084541062802, "eval_unseen_f1_valid": 0.9949429613077737, "eval_unseen_f1_invalid": 0.9909378292939937, "eval_unseen_macro_f1": 0.9929403953008837, "eval_unseen_majority_baseline": 0.6400966183574879, "eval_unseen_runtime": 0.3049, "eval_unseen_samples_per_second": 21728.287, "eval_unseen_steps_per_second": 170.572, "epoch": 9.642426677380474, "step": 24000 }, { "loss": 2.380460500717163e-06, "grad_norm": 8.719210018170998e-05, "learning_rate": 2.9307813166588036e-07, "epoch": 9.662515066291684, "step": 24050 }, { "loss": 3.890357911586761e-06, "grad_norm": 0.00022959259513299912, "learning_rate": 2.592945542431946e-07, "epoch": 9.682603455202893, "step": 24100 }, { "loss": 2.6455894112586974e-06, "grad_norm": 0.0001019965493469499, "learning_rate": 2.2757410681315537e-07, "epoch": 9.702691844114103, "step": 24150 }, { "loss": 2.2900477051734925e-06, "grad_norm": 0.00013137496716808528, "learning_rate": 1.9791810506693542e-07, "epoch": 9.722780233025311, "step": 24200 }, { "loss": 2.7436017990112305e-06, "grad_norm": 9.810757910599932e-05, "learning_rate": 1.7032777906723087e-07, "epoch": 9.742868621936521, "step": 24250 }, { "loss": 2.2519752383232116e-06, "grad_norm": 0.00012141554907429963, "learning_rate": 1.4480427319726875e-07, "epoch": 9.76295701084773, "step": 24300 }, { "loss": 2.942308783531189e-06, "grad_norm": 0.00010106329864356667, "learning_rate": 1.2134864611333952e-07, "epoch": 9.78304539975894, "step": 24350 }, { "loss": 4.490092396736145e-06, "grad_norm": 0.000193135958397761, "learning_rate": 9.996187070087648e-08, "epoch": 9.803133788670149, "step": 24400 }, { "loss": 2.4335458874702454e-06, "grad_norm": 0.0001166210204246454, "learning_rate": 8.064483403410483e-08, "epoch": 9.823222177581357, "step": 24450 }, { "loss": 2.541393041610718e-06, "grad_norm": 8.921896369429305e-05, "learning_rate": 6.339833733924327e-08, "epoch": 9.843310566492567, "step": 24500 }, { "eval_seen_loss": 0.013017052784562111, "eval_seen_accuracy": 0.9980374396135265, "eval_seen_f1_valid": 0.9984678845020625, "eval_seen_f1_invalid": 0.9972706277556163, "eval_seen_macro_f1": 0.9978692561288394, "eval_seen_majority_baseline": 0.6400966183574879, "eval_seen_runtime": 0.3165, "eval_seen_samples_per_second": 20925.887, "eval_seen_steps_per_second": 164.273, "epoch": 9.843310566492567, "step": 24500 }, { "eval_unseen_loss": 0.04933434724807739, "eval_unseen_accuracy": 0.9935084541062802, "eval_unseen_f1_valid": 0.9949429613077737, "eval_unseen_f1_invalid": 0.9909378292939937, "eval_unseen_macro_f1": 0.9929403953008837, "eval_unseen_majority_baseline": 0.6400966183574879, "eval_unseen_runtime": 0.3035, "eval_unseen_samples_per_second": 21822.375, "eval_unseen_steps_per_second": 171.311, "epoch": 9.843310566492567, "step": 24500 }, { "loss": 2.145916223526001e-06, "grad_norm": 9.508332004770637e-05, "learning_rate": 4.8223095961297257e-08, "epoch": 9.863398955403778, "step": 24550 }, { "loss": 2.3793429136276247e-06, "grad_norm": 0.00017216239939443767, "learning_rate": 3.511973933434942e-08, "epoch": 9.883487344314986, "step": 24600 }, { "loss": 3.3716857433319093e-06, "grad_norm": 0.00010370145901106298, "learning_rate": 2.4088810955474883e-08, "epoch": 9.903575733226194, "step": 24650 }, { "loss": 2.418123185634613e-06, "grad_norm": 0.00010311349615221843, "learning_rate": 1.513076836220373e-08, "epoch": 9.923664122137405, "step": 24700 }, { "loss": 2.4419650435447693e-06, "grad_norm": 9.561217302689329e-05, "learning_rate": 8.24598311352509e-09, "epoch": 9.943752511048613, "step": 24750 }, { "loss": 2.808086574077606e-06, "grad_norm": 0.00010774183465400711, "learning_rate": 3.434740774482803e-09, "epoch": 9.963840899959823, "step": 24800 }, { "loss": 4.667192697525024e-06, "grad_norm": 9.36409633141011e-05, "learning_rate": 6.972409043404238e-10, "epoch": 9.983929288871032, "step": 24850 }, { "eval_seen_loss": 0.013024607673287392, "eval_seen_accuracy": 0.9980374396135265, "eval_seen_f1_valid": 0.9984678845020625, "eval_seen_f1_invalid": 0.9972706277556163, "eval_seen_macro_f1": 0.9978692561288394, "eval_seen_majority_baseline": 0.6400966183574879, "eval_seen_runtime": 0.3177, "eval_seen_samples_per_second": 20853.119, "eval_seen_steps_per_second": 163.702, "epoch": 10.0, "step": 24890 }, { "eval_unseen_loss": 0.0492788590490818, "eval_unseen_accuracy": 0.9935084541062802, "eval_unseen_f1_valid": 0.9949429613077737, "eval_unseen_f1_invalid": 0.9909378292939937, "eval_unseen_macro_f1": 0.9929403953008837, "eval_unseen_majority_baseline": 0.6400966183574879, "eval_unseen_runtime": 0.3068, "eval_unseen_samples_per_second": 21589.715, "eval_unseen_steps_per_second": 169.484, "epoch": 10.0, "step": 24890 }, { "train_runtime": 222.8072, "train_samples_per_second": 7146.985, "train_steps_per_second": 111.711, "total_flos": 1015596244174848.0, "train_loss": 0.01661168186644346, "epoch": 10.0, "step": 24890 }, { "eval_seen_loss": 0.011836923658847809, "eval_seen_accuracy": 0.9978864734299517, "eval_seen_f1_valid": 0.9983498349834984, "eval_seen_f1_invalid": 0.9970612930310664, "eval_seen_macro_f1": 0.9977055640072824, "eval_seen_majority_baseline": 0.6400966183574879, "eval_seen_runtime": 0.3194, "eval_seen_samples_per_second": 20735.801, "eval_seen_steps_per_second": 162.781, "epoch": 10.0, "step": 24890 }, { "eval_unseen_loss": 0.04228868708014488, "eval_unseen_accuracy": 0.9947161835748792, "eval_unseen_f1_valid": 0.9958808991408732, "eval_unseen_f1_invalid": 0.9926331298673964, "eval_unseen_macro_f1": 0.9942570145041347, "eval_unseen_majority_baseline": 0.6400966183574879, "eval_unseen_runtime": 0.3081, "eval_unseen_samples_per_second": 21497.784, "eval_unseen_steps_per_second": 168.763, "epoch": 10.0, "step": 24890 } ] }