Nawah-RuleCheck-5M / train_metrics.json
oddadmix's picture
Arabic rule-checking classifier — size-ladder rung
0655de3 verified
Raw
History Blame Contribute Delete
149 kB
{
"final_eval": {
"eval_seen_loss": 0.011836923658847809,
"eval_seen_accuracy": 0.9978864734299517,
"eval_seen_f1_valid": 0.9983498349834984,
"eval_seen_f1_invalid": 0.9970612930310664,
"eval_seen_macro_f1": 0.9977055640072824,
"eval_seen_majority_baseline": 0.6400966183574879,
"eval_seen_runtime": 0.3194,
"eval_seen_samples_per_second": 20735.801,
"eval_seen_steps_per_second": 162.781,
"epoch": 10.0,
"eval_unseen_loss": 0.04228868708014488,
"eval_unseen_accuracy": 0.9947161835748792,
"eval_unseen_f1_valid": 0.9958808991408732,
"eval_unseen_f1_invalid": 0.9926331298673964,
"eval_unseen_macro_f1": 0.9942570145041347,
"eval_unseen_majority_baseline": 0.6400966183574879,
"eval_unseen_runtime": 0.3081,
"eval_unseen_samples_per_second": 21497.784,
"eval_unseen_steps_per_second": 168.763
},
"per_rule": {
"seen": {
"has_city": {
"acc": 0.9907,
"n": 648
},
"no_excess_punct": {
"acc": 0.9985,
"n": 647
},
"no_phone": {
"acc": 1.0,
"n": 471
},
"has_phone": {
"acc": 1.0,
"n": 524
},
"has_price": {
"acc": 1.0,
"n": 521
},
"no_email": {
"acc": 1.0,
"n": 682
},
"no_url": {
"acc": 1.0,
"n": 513
},
"has_date": {
"acc": 0.9982,
"n": 560
},
"ends_question": {
"acc": 1.0,
"n": 621
},
"no_latin": {
"acc": 1.0,
"n": 638
},
"has_number": {
"acc": 1.0,
"n": 511
},
"max_words_30": {
"acc": 1.0,
"n": 46
},
"min_words_25": {
"acc": 1.0,
"n": 40
},
"min_words_15": {
"acc": 0.9762,
"n": 42
},
"max_words_50": {
"acc": 0.9767,
"n": 43
},
"min_words_20": {
"acc": 0.9714,
"n": 35
},
"max_words_25": {
"acc": 1.0,
"n": 20
},
"min_words_30": {
"acc": 0.9744,
"n": 39
},
"max_words_40": {
"acc": 0.913,
"n": 23
}
},
"unseen": {
"has_city": {
"acc": 0.9938,
"n": 648
},
"no_excess_punct": {
"acc": 0.9985,
"n": 647
},
"no_phone": {
"acc": 0.9639,
"n": 471
},
"has_phone": {
"acc": 1.0,
"n": 524
},
"has_price": {
"acc": 1.0,
"n": 521
},
"no_email": {
"acc": 1.0,
"n": 682
},
"no_url": {
"acc": 1.0,
"n": 513
},
"has_date": {
"acc": 0.9982,
"n": 560
},
"ends_question": {
"acc": 1.0,
"n": 621
},
"no_latin": {
"acc": 0.9969,
"n": 638
},
"has_number": {
"acc": 1.0,
"n": 511
},
"max_words_30": {
"acc": 0.9783,
"n": 46
},
"min_words_25": {
"acc": 1.0,
"n": 40
},
"min_words_15": {
"acc": 0.9762,
"n": 42
},
"max_words_50": {
"acc": 0.9767,
"n": 43
},
"min_words_20": {
"acc": 0.9429,
"n": 35
},
"max_words_25": {
"acc": 0.95,
"n": 20
},
"min_words_30": {
"acc": 0.9487,
"n": 39
},
"max_words_40": {
"acc": 0.913,
"n": 23
}
}
},
"log_history": [
{
"loss": 0.6704658508300781,
"grad_norm": 6.961378574371338,
"learning_rate": 9.800000000000001e-06,
"epoch": 0.020088388911209322,
"step": 50
},
{
"loss": 0.6055447769165039,
"grad_norm": 6.502827167510986,
"learning_rate": 1.9800000000000004e-05,
"epoch": 0.040176777822418644,
"step": 100
},
{
"loss": 0.5635388946533203,
"grad_norm": 10.348727226257324,
"learning_rate": 2.98e-05,
"epoch": 0.060265166733627966,
"step": 150
},
{
"loss": 0.49288463592529297,
"grad_norm": 8.155802726745605,
"learning_rate": 3.9800000000000005e-05,
"epoch": 0.08035355564483729,
"step": 200
},
{
"loss": 0.3849527359008789,
"grad_norm": 7.203456878662109,
"learning_rate": 4.9800000000000004e-05,
"epoch": 0.1004419445560466,
"step": 250
},
{
"loss": 0.2943598365783691,
"grad_norm": 5.37825345993042,
"learning_rate": 5.9800000000000003e-05,
"epoch": 0.12053033346725593,
"step": 300
},
{
"loss": 0.2564892578125,
"grad_norm": 10.878361701965332,
"learning_rate": 6.98e-05,
"epoch": 0.14061872237846526,
"step": 350
},
{
"loss": 0.21619060516357422,
"grad_norm": 9.906046867370605,
"learning_rate": 7.98e-05,
"epoch": 0.16070711128967458,
"step": 400
},
{
"loss": 0.20003364562988282,
"grad_norm": 4.608164310455322,
"learning_rate": 8.98e-05,
"epoch": 0.1807955002008839,
"step": 450
},
{
"loss": 0.17786117553710937,
"grad_norm": 12.025157928466797,
"learning_rate": 9.98e-05,
"epoch": 0.2008838891120932,
"step": 500
},
{
"eval_seen_loss": 0.15569795668125153,
"eval_seen_accuracy": 0.9334239130434783,
"eval_seen_f1_valid": 0.9492461733225918,
"eval_seen_f1_invalid": 0.9032682605834613,
"eval_seen_macro_f1": 0.9262572169530265,
"eval_seen_majority_baseline": 0.6400966183574879,
"eval_seen_runtime": 0.3266,
"eval_seen_samples_per_second": 20283.255,
"eval_seen_steps_per_second": 159.228,
"epoch": 0.2008838891120932,
"step": 500
},
{
"eval_unseen_loss": 0.20032644271850586,
"eval_unseen_accuracy": 0.9172705314009661,
"eval_unseen_f1_valid": 0.9373571101966164,
"eval_unseen_f1_invalid": 0.8782222222222221,
"eval_unseen_macro_f1": 0.9077896662094193,
"eval_unseen_majority_baseline": 0.6400966183574879,
"eval_unseen_runtime": 0.3075,
"eval_unseen_samples_per_second": 21539.634,
"eval_unseen_steps_per_second": 169.091,
"epoch": 0.2008838891120932,
"step": 500
},
{
"loss": 0.16435718536376953,
"grad_norm": 2.128711462020874,
"learning_rate": 9.999900412031836e-05,
"epoch": 0.22097227802330252,
"step": 550
},
{
"loss": 0.15185343742370605,
"grad_norm": 5.858470439910889,
"learning_rate": 9.999593481178791e-05,
"epoch": 0.24106066693451186,
"step": 600
},
{
"loss": 0.1407579231262207,
"grad_norm": 8.060696601867676,
"learning_rate": 9.999079178693804e-05,
"epoch": 0.2611490558457212,
"step": 650
},
{
"loss": 0.13899617195129393,
"grad_norm": 2.430171489715576,
"learning_rate": 9.998357525908964e-05,
"epoch": 0.2812374447569305,
"step": 700
},
{
"loss": 0.12171868324279785,
"grad_norm": 6.015133857727051,
"learning_rate": 9.997428552756763e-05,
"epoch": 0.3013258336681398,
"step": 750
},
{
"loss": 0.11208045959472657,
"grad_norm": 5.097869873046875,
"learning_rate": 9.996292297768872e-05,
"epoch": 0.32141422257934915,
"step": 800
},
{
"loss": 0.08406662940979004,
"grad_norm": 3.9282870292663574,
"learning_rate": 9.994948808074534e-05,
"epoch": 0.34150261149055844,
"step": 850
},
{
"loss": 0.08543995857238769,
"grad_norm": 1.9250595569610596,
"learning_rate": 9.993398139398606e-05,
"epoch": 0.3615910004017678,
"step": 900
},
{
"loss": 0.10277658462524414,
"grad_norm": 3.51467227935791,
"learning_rate": 9.991640356059261e-05,
"epoch": 0.3816793893129771,
"step": 950
},
{
"loss": 0.08797937393188476,
"grad_norm": 5.154219150543213,
"learning_rate": 9.989675530965303e-05,
"epoch": 0.4017677782241864,
"step": 1000
},
{
"eval_seen_loss": 0.07947713881731033,
"eval_seen_accuracy": 0.9719202898550725,
"eval_seen_f1_valid": 0.9782710280373832,
"eval_seen_f1_invalid": 0.9603242320819113,
"eval_seen_macro_f1": 0.9692976300596472,
"eval_seen_majority_baseline": 0.6400966183574879,
"eval_seen_runtime": 0.3186,
"eval_seen_samples_per_second": 20791.68,
"eval_seen_steps_per_second": 163.22,
"epoch": 0.4017677782241864,
"step": 1000
},
{
"eval_unseen_loss": 0.12618499994277954,
"eval_unseen_accuracy": 0.9581823671497585,
"eval_unseen_f1_valid": 0.967522570055106,
"eval_unseen_f1_invalid": 0.9413011231193049,
"eval_unseen_macro_f1": 0.9544118465872055,
"eval_unseen_majority_baseline": 0.6400966183574879,
"eval_unseen_runtime": 0.2981,
"eval_unseen_samples_per_second": 22222.687,
"eval_unseen_steps_per_second": 174.453,
"epoch": 0.4017677782241864,
"step": 1000
},
{
"loss": 0.07849720478057862,
"grad_norm": 2.367215633392334,
"learning_rate": 9.987503745613157e-05,
"epoch": 0.42185616713539575,
"step": 1050
},
{
"loss": 0.06738131999969482,
"grad_norm": 0.9078812003135681,
"learning_rate": 9.985125090083481e-05,
"epoch": 0.44194455604660504,
"step": 1100
},
{
"loss": 0.05828128814697266,
"grad_norm": 3.2039096355438232,
"learning_rate": 9.982539663037431e-05,
"epoch": 0.4620329449578144,
"step": 1150
},
{
"loss": 0.07166430950164795,
"grad_norm": 3.850139617919922,
"learning_rate": 9.979747571712573e-05,
"epoch": 0.4821213338690237,
"step": 1200
},
{
"loss": 0.061166787147521974,
"grad_norm": 12.084016799926758,
"learning_rate": 9.976748931918429e-05,
"epoch": 0.502209722780233,
"step": 1250
},
{
"loss": 0.05616282939910889,
"grad_norm": 3.185512065887451,
"learning_rate": 9.973543868031676e-05,
"epoch": 0.5222981116914424,
"step": 1300
},
{
"loss": 0.04871833324432373,
"grad_norm": 3.6474103927612305,
"learning_rate": 9.970132512990988e-05,
"epoch": 0.5423865006026517,
"step": 1350
},
{
"loss": 0.04807154655456543,
"grad_norm": 2.4606831073760986,
"learning_rate": 9.966515008291524e-05,
"epoch": 0.562474889513861,
"step": 1400
},
{
"loss": 0.04073795795440674,
"grad_norm": 1.6424299478530884,
"learning_rate": 9.962691503979052e-05,
"epoch": 0.5825632784250703,
"step": 1450
},
{
"loss": 0.05464828491210937,
"grad_norm": 0.40458548069000244,
"learning_rate": 9.95866215864373e-05,
"epoch": 0.6026516673362796,
"step": 1500
},
{
"eval_seen_loss": 0.04147813469171524,
"eval_seen_accuracy": 0.9877717391304348,
"eval_seen_f1_valid": 0.9904357066950054,
"eval_seen_f1_invalid": 0.9830508474576272,
"eval_seen_macro_f1": 0.9867432770763163,
"eval_seen_majority_baseline": 0.6400966183574879,
"eval_seen_runtime": 0.3165,
"eval_seen_samples_per_second": 20927.195,
"eval_seen_steps_per_second": 164.284,
"epoch": 0.6026516673362796,
"step": 1500
},
{
"eval_unseen_loss": 0.08285732567310333,
"eval_unseen_accuracy": 0.9770531400966184,
"eval_unseen_f1_valid": 0.9819990525817148,
"eval_unseen_f1_invalid": 0.9683597002497918,
"eval_unseen_macro_f1": 0.9751793764157533,
"eval_unseen_majority_baseline": 0.6400966183574879,
"eval_unseen_runtime": 0.3155,
"eval_unseen_samples_per_second": 20994.308,
"eval_unseen_steps_per_second": 164.81,
"epoch": 0.6026516673362796,
"step": 1500
},
{
"loss": 0.04056734085083008,
"grad_norm": 19.595773696899414,
"learning_rate": 9.954427139413534e-05,
"epoch": 0.622740056247489,
"step": 1550
},
{
"loss": 0.039789986610412595,
"grad_norm": 2.786728858947754,
"learning_rate": 9.949986621947312e-05,
"epoch": 0.6428284451586983,
"step": 1600
},
{
"loss": 0.03137856245040894,
"grad_norm": 1.161686658859253,
"learning_rate": 9.94534079042751e-05,
"epoch": 0.6629168340699076,
"step": 1650
},
{
"loss": 0.0490680456161499,
"grad_norm": 0.8502035140991211,
"learning_rate": 9.94048983755253e-05,
"epoch": 0.6830052229811169,
"step": 1700
},
{
"loss": 0.036091387271881104,
"grad_norm": 2.027765989303589,
"learning_rate": 9.93543396452873e-05,
"epoch": 0.7030936118923262,
"step": 1750
},
{
"loss": 0.03713906049728394,
"grad_norm": 1.404341697692871,
"learning_rate": 9.930173381062093e-05,
"epoch": 0.7231820008035356,
"step": 1800
},
{
"loss": 0.035144150257110596,
"grad_norm": 0.33481183648109436,
"learning_rate": 9.924708305349509e-05,
"epoch": 0.7432703897147449,
"step": 1850
},
{
"loss": 0.038848557472229005,
"grad_norm": 4.593264579772949,
"learning_rate": 9.919038964069746e-05,
"epoch": 0.7633587786259542,
"step": 1900
},
{
"loss": 0.03796250820159912,
"grad_norm": 2.970884084701538,
"learning_rate": 9.913165592374031e-05,
"epoch": 0.7834471675371635,
"step": 1950
},
{
"loss": 0.030259652137756346,
"grad_norm": 0.5110931992530823,
"learning_rate": 9.907088433876308e-05,
"epoch": 0.8035355564483728,
"step": 2000
},
{
"eval_seen_loss": 0.03181261196732521,
"eval_seen_accuracy": 0.9907910628019324,
"eval_seen_f1_valid": 0.9928344884294608,
"eval_seen_f1_invalid": 0.9871172122492081,
"eval_seen_macro_f1": 0.9899758503393344,
"eval_seen_majority_baseline": 0.6400966183574879,
"eval_seen_runtime": 0.3228,
"eval_seen_samples_per_second": 20519.36,
"eval_seen_steps_per_second": 161.082,
"epoch": 0.8035355564483728,
"step": 2000
},
{
"eval_unseen_loss": 0.09161130338907242,
"eval_unseen_accuracy": 0.9781099033816425,
"eval_unseen_f1_valid": 0.9830270396816106,
"eval_unseen_f1_invalid": 0.9691817215727949,
"eval_unseen_macro_f1": 0.9761043806272027,
"eval_unseen_majority_baseline": 0.6400966183574879,
"eval_unseen_runtime": 0.3041,
"eval_unseen_samples_per_second": 21783.433,
"eval_unseen_steps_per_second": 171.005,
"epoch": 0.8035355564483728,
"step": 2000
},
{
"loss": 0.027805449962615966,
"grad_norm": 0.061120375990867615,
"learning_rate": 9.900807740643124e-05,
"epoch": 0.8236239453595822,
"step": 2050
},
{
"loss": 0.03178966760635376,
"grad_norm": 0.05971622094511986,
"learning_rate": 9.894323773183181e-05,
"epoch": 0.8437123342707915,
"step": 2100
},
{
"loss": 0.03385076999664307,
"grad_norm": 0.3821258544921875,
"learning_rate": 9.887636800436526e-05,
"epoch": 0.8638007231820009,
"step": 2150
},
{
"loss": 0.03567046165466309,
"grad_norm": 0.27875784039497375,
"learning_rate": 9.880747099763402e-05,
"epoch": 0.8838891120932101,
"step": 2200
},
{
"loss": 0.026896452903747557,
"grad_norm": 0.13735617697238922,
"learning_rate": 9.873654956932737e-05,
"epoch": 0.9039775010044194,
"step": 2250
},
{
"loss": 0.0216548752784729,
"grad_norm": 0.14634734392166138,
"learning_rate": 9.866360666110293e-05,
"epoch": 0.9240658899156288,
"step": 2300
},
{
"loss": 0.028975086212158205,
"grad_norm": 7.620655059814453,
"learning_rate": 9.858864529846467e-05,
"epoch": 0.9441542788268381,
"step": 2350
},
{
"loss": 0.030748412609100342,
"grad_norm": 2.8802390098571777,
"learning_rate": 9.851166859063744e-05,
"epoch": 0.9642426677380475,
"step": 2400
},
{
"loss": 0.026972088813781738,
"grad_norm": 5.01859188079834,
"learning_rate": 9.843267973043787e-05,
"epoch": 0.9843310566492567,
"step": 2450
},
{
"loss": 0.025179855823516846,
"grad_norm": 0.2297878861427307,
"learning_rate": 9.835168199414214e-05,
"epoch": 1.004419445560466,
"step": 2500
},
{
"eval_seen_loss": 0.023833297193050385,
"eval_seen_accuracy": 0.9944142512077294,
"eval_seen_f1_valid": 0.9956414183060431,
"eval_seen_f1_invalid": 0.9922252574070183,
"eval_seen_macro_f1": 0.9939333378565307,
"eval_seen_majority_baseline": 0.6400966183574879,
"eval_seen_runtime": 0.3285,
"eval_seen_samples_per_second": 20167.338,
"eval_seen_steps_per_second": 158.318,
"epoch": 1.004419445560466,
"step": 2500
},
{
"eval_unseen_loss": 0.06532388180494308,
"eval_unseen_accuracy": 0.9844504830917874,
"eval_unseen_f1_valid": 0.9878695088917677,
"eval_unseen_f1_invalid": 0.978347698129073,
"eval_unseen_macro_f1": 0.9831086035104204,
"eval_unseen_majority_baseline": 0.6400966183574879,
"eval_unseen_runtime": 0.3064,
"eval_unseen_samples_per_second": 21618.559,
"eval_unseen_steps_per_second": 169.711,
"epoch": 1.004419445560466,
"step": 2500
},
{
"loss": 0.025775249004364013,
"grad_norm": 1.0400502681732178,
"learning_rate": 9.826867874134995e-05,
"epoch": 1.0245078344716754,
"step": 2550
},
{
"loss": 0.0226438307762146,
"grad_norm": 1.6363939046859741,
"learning_rate": 9.81836734148452e-05,
"epoch": 1.0445962233828847,
"step": 2600
},
{
"loss": 0.01809248685836792,
"grad_norm": 0.01623135432600975,
"learning_rate": 9.809666954045322e-05,
"epoch": 1.064684612294094,
"step": 2650
},
{
"loss": 0.021049981117248536,
"grad_norm": 0.021346036344766617,
"learning_rate": 9.800767072689449e-05,
"epoch": 1.0847730012053034,
"step": 2700
},
{
"loss": 0.026336238384246827,
"grad_norm": 0.03480149060487747,
"learning_rate": 9.791668066563497e-05,
"epoch": 1.1048613901165127,
"step": 2750
},
{
"loss": 0.01243409514427185,
"grad_norm": 0.07298510521650314,
"learning_rate": 9.782370313073301e-05,
"epoch": 1.1249497790277219,
"step": 2800
},
{
"loss": 0.015609384775161743,
"grad_norm": 0.09682580828666687,
"learning_rate": 9.77287419786828e-05,
"epoch": 1.1450381679389312,
"step": 2850
},
{
"loss": 0.015297083854675294,
"grad_norm": 0.5698757767677307,
"learning_rate": 9.763180114825439e-05,
"epoch": 1.1651265568501405,
"step": 2900
},
{
"loss": 0.00734399139881134,
"grad_norm": 0.009613298811018467,
"learning_rate": 9.753288466033033e-05,
"epoch": 1.18521494576135,
"step": 2950
},
{
"loss": 0.025555052757263184,
"grad_norm": 0.05337614193558693,
"learning_rate": 9.743199661773888e-05,
"epoch": 1.2053033346725592,
"step": 3000
},
{
"eval_seen_loss": 0.03496118634939194,
"eval_seen_accuracy": 0.9909420289855072,
"eval_seen_f1_valid": 0.9929295309922225,
"eval_seen_f1_invalid": 0.9874002519949601,
"eval_seen_macro_f1": 0.9901648914935912,
"eval_seen_majority_baseline": 0.6400966183574879,
"eval_seen_runtime": 0.3128,
"eval_seen_samples_per_second": 21174.99,
"eval_seen_steps_per_second": 166.229,
"epoch": 1.2053033346725592,
"step": 3000
},
{
"eval_unseen_loss": 0.0712013989686966,
"eval_unseen_accuracy": 0.9849033816425121,
"eval_unseen_f1_valid": 0.9882103277528884,
"eval_unseen_f1_invalid": 0.9790180444817457,
"eval_unseen_macro_f1": 0.9836141861173171,
"eval_unseen_majority_baseline": 0.6400966183574879,
"eval_unseen_runtime": 0.3131,
"eval_unseen_samples_per_second": 21157.43,
"eval_unseen_steps_per_second": 166.091,
"epoch": 1.2053033346725592,
"step": 3000
},
{
"loss": 0.027643091678619384,
"grad_norm": 2.102973222732544,
"learning_rate": 9.732914120508388e-05,
"epoch": 1.2253917235837686,
"step": 3050
},
{
"loss": 0.024755525588989257,
"grad_norm": 0.04891473799943924,
"learning_rate": 9.722432268857117e-05,
"epoch": 1.245480112494978,
"step": 3100
},
{
"loss": 0.026731245517730713,
"grad_norm": 0.1450469195842743,
"learning_rate": 9.711754541583158e-05,
"epoch": 1.2655685014061873,
"step": 3150
},
{
"loss": 0.019302159547805786,
"grad_norm": 0.19893020391464233,
"learning_rate": 9.700881381574063e-05,
"epoch": 1.2856568903173966,
"step": 3200
},
{
"loss": 0.02171895742416382,
"grad_norm": 0.031684305518865585,
"learning_rate": 9.689813239823489e-05,
"epoch": 1.305745279228606,
"step": 3250
},
{
"loss": 0.018455970287322997,
"grad_norm": 0.09408152848482132,
"learning_rate": 9.678550575412486e-05,
"epoch": 1.3258336681398153,
"step": 3300
},
{
"loss": 0.025521416664123536,
"grad_norm": 0.09570422768592834,
"learning_rate": 9.667093855490452e-05,
"epoch": 1.3459220570510246,
"step": 3350
},
{
"loss": 0.02281453847885132,
"grad_norm": 0.3635101914405823,
"learning_rate": 9.655443555255764e-05,
"epoch": 1.3660104459622338,
"step": 3400
},
{
"loss": 0.010848090648651124,
"grad_norm": 0.2485629916191101,
"learning_rate": 9.643600157936066e-05,
"epoch": 1.386098834873443,
"step": 3450
},
{
"loss": 0.016650997400283814,
"grad_norm": 0.9609498977661133,
"learning_rate": 9.631564154768222e-05,
"epoch": 1.4061872237846524,
"step": 3500
},
{
"eval_seen_loss": 0.017499525099992752,
"eval_seen_accuracy": 0.9954710144927537,
"eval_seen_f1_valid": 0.9964639321074964,
"eval_seen_f1_invalid": 0.9937027707808564,
"eval_seen_macro_f1": 0.9950833514441764,
"eval_seen_majority_baseline": 0.6400966183574879,
"eval_seen_runtime": 0.3159,
"eval_seen_samples_per_second": 20968.449,
"eval_seen_steps_per_second": 164.607,
"epoch": 1.4061872237846524,
"step": 3500
},
{
"eval_unseen_loss": 0.028747964650392532,
"eval_unseen_accuracy": 0.9919987922705314,
"eval_unseen_f1_valid": 0.9937625044133225,
"eval_unseen_f1_invalid": 0.9888444537992003,
"eval_unseen_macro_f1": 0.9913034791062614,
"eval_unseen_majority_baseline": 0.6400966183574879,
"eval_unseen_runtime": 0.2935,
"eval_unseen_samples_per_second": 22566.909,
"eval_unseen_steps_per_second": 177.156,
"epoch": 1.4061872237846524,
"step": 3500
},
{
"loss": 0.017104147672653197,
"grad_norm": 0.3069566786289215,
"learning_rate": 9.619336044977947e-05,
"epoch": 1.4262756126958618,
"step": 3550
},
{
"loss": 0.013962976932525635,
"grad_norm": 0.15175199508666992,
"learning_rate": 9.606916335759091e-05,
"epoch": 1.4463640016070711,
"step": 3600
},
{
"loss": 0.023543903827667235,
"grad_norm": 0.09805657714605331,
"learning_rate": 9.594305542252615e-05,
"epoch": 1.4664523905182805,
"step": 3650
},
{
"loss": 0.01416290044784546,
"grad_norm": 3.126929759979248,
"learning_rate": 9.581504187525208e-05,
"epoch": 1.4865407794294898,
"step": 3700
},
{
"loss": 0.01324806809425354,
"grad_norm": 0.7419432401657104,
"learning_rate": 9.568512802547605e-05,
"epoch": 1.506629168340699,
"step": 3750
},
{
"loss": 0.019409667253494262,
"grad_norm": 0.042299091815948486,
"learning_rate": 9.555331926172559e-05,
"epoch": 1.5267175572519083,
"step": 3800
},
{
"loss": 0.023891074657440184,
"grad_norm": 0.44470810890197754,
"learning_rate": 9.541962105112488e-05,
"epoch": 1.5468059461631176,
"step": 3850
},
{
"loss": 0.011780786514282226,
"grad_norm": 3.8765432834625244,
"learning_rate": 9.528403893916802e-05,
"epoch": 1.566894335074327,
"step": 3900
},
{
"loss": 0.016372852325439453,
"grad_norm": 0.03911309689283371,
"learning_rate": 9.514657854948898e-05,
"epoch": 1.5869827239855363,
"step": 3950
},
{
"loss": 0.010347286462783814,
"grad_norm": 1.1136096715927124,
"learning_rate": 9.500724558362839e-05,
"epoch": 1.6070711128967456,
"step": 4000
},
{
"eval_seen_loss": 0.016062559559941292,
"eval_seen_accuracy": 0.9950181159420289,
"eval_seen_f1_valid": 0.9961034360609281,
"eval_seen_f1_invalid": 0.9930947897049591,
"eval_seen_macro_f1": 0.9945991128829437,
"eval_seen_majority_baseline": 0.6400966183574879,
"eval_seen_runtime": 0.3221,
"eval_seen_samples_per_second": 20567.513,
"eval_seen_steps_per_second": 161.46,
"epoch": 1.6070711128967456,
"step": 4000
},
{
"eval_unseen_loss": 0.07382287085056305,
"eval_unseen_accuracy": 0.9827898550724637,
"eval_unseen_f1_valid": 0.9864672364672364,
"eval_unseen_f1_invalid": 0.97636815920398,
"eval_unseen_macro_f1": 0.9814176978356082,
"eval_unseen_majority_baseline": 0.6400966183574879,
"eval_unseen_runtime": 0.3163,
"eval_unseen_samples_per_second": 20943.475,
"eval_unseen_steps_per_second": 164.411,
"epoch": 1.6070711128967456,
"step": 4000
},
{
"loss": 0.03152747869491577,
"grad_norm": 0.06820331513881683,
"learning_rate": 9.486604582079704e-05,
"epoch": 1.627159501807955,
"step": 4050
},
{
"loss": 0.015730949640274047,
"grad_norm": 0.02219122089445591,
"learning_rate": 9.472298511763613e-05,
"epoch": 1.6472478907191643,
"step": 4100
},
{
"loss": 0.014006189107894897,
"grad_norm": 4.819547176361084,
"learning_rate": 9.457806940797439e-05,
"epoch": 1.6673362796303737,
"step": 4150
},
{
"loss": 0.01701338529586792,
"grad_norm": 0.02137128822505474,
"learning_rate": 9.443130470258198e-05,
"epoch": 1.687424668541583,
"step": 4200
},
{
"loss": 0.015609605312347412,
"grad_norm": 0.14972175657749176,
"learning_rate": 9.428269708892112e-05,
"epoch": 1.7075130574527924,
"step": 4250
},
{
"loss": 0.009463921189308167,
"grad_norm": 0.024293815717101097,
"learning_rate": 9.413225273089364e-05,
"epoch": 1.7276014463640017,
"step": 4300
},
{
"loss": 0.017783876657485962,
"grad_norm": 1.126176118850708,
"learning_rate": 9.397997786858526e-05,
"epoch": 1.747689835275211,
"step": 4350
},
{
"loss": 0.017371171712875368,
"grad_norm": 1.4426050186157227,
"learning_rate": 9.382587881800687e-05,
"epoch": 1.7677782241864204,
"step": 4400
},
{
"loss": 0.013080412149429321,
"grad_norm": 0.010198249481618404,
"learning_rate": 9.366996197083245e-05,
"epoch": 1.7878666130976297,
"step": 4450
},
{
"loss": 0.010468505620956421,
"grad_norm": 0.4493156671524048,
"learning_rate": 9.351223379413398e-05,
"epoch": 1.8079550020088389,
"step": 4500
},
{
"eval_seen_loss": 0.018062112852931023,
"eval_seen_accuracy": 0.9950181159420289,
"eval_seen_f1_valid": 0.9961071133655774,
"eval_seen_f1_invalid": 0.9930832110668623,
"eval_seen_macro_f1": 0.9945951622162199,
"eval_seen_majority_baseline": 0.6400966183574879,
"eval_seen_runtime": 0.3141,
"eval_seen_samples_per_second": 21087.559,
"eval_seen_steps_per_second": 165.542,
"epoch": 1.8079550020088389,
"step": 4500
},
{
"eval_unseen_loss": 0.051321063190698624,
"eval_unseen_accuracy": 0.9892814009661836,
"eval_unseen_f1_valid": 0.9916026020106447,
"eval_unseen_f1_invalid": 0.985186730648863,
"eval_unseen_macro_f1": 0.9883946663297538,
"eval_unseen_majority_baseline": 0.6400966183574879,
"eval_unseen_runtime": 0.3119,
"eval_unseen_samples_per_second": 21237.112,
"eval_unseen_steps_per_second": 166.716,
"epoch": 1.8079550020088389,
"step": 4500
},
{
"loss": 0.009371167421340943,
"grad_norm": 0.23130910098552704,
"learning_rate": 9.335270083011327e-05,
"epoch": 1.8280433909200482,
"step": 4550
},
{
"loss": 0.00927388072013855,
"grad_norm": 0.04569007828831673,
"learning_rate": 9.319136969583053e-05,
"epoch": 1.8481317798312575,
"step": 4600
},
{
"loss": 0.018707298040390015,
"grad_norm": 1.7949227094650269,
"learning_rate": 9.302824708292994e-05,
"epoch": 1.8682201687424669,
"step": 4650
},
{
"loss": 0.010992642641067505,
"grad_norm": 0.02038896456360817,
"learning_rate": 9.286333975736206e-05,
"epoch": 1.8883085576536762,
"step": 4700
},
{
"loss": 0.016763041019439696,
"grad_norm": 36.40946578979492,
"learning_rate": 9.269665455910328e-05,
"epoch": 1.9083969465648853,
"step": 4750
},
{
"loss": 0.013855984210968017,
"grad_norm": 0.3852629065513611,
"learning_rate": 9.252819840187203e-05,
"epoch": 1.9284853354760947,
"step": 4800
},
{
"loss": 0.008902734518051148,
"grad_norm": 0.015681391581892967,
"learning_rate": 9.235797827284202e-05,
"epoch": 1.948573724387304,
"step": 4850
},
{
"loss": 0.008782572746276855,
"grad_norm": 0.1879400908946991,
"learning_rate": 9.218600123235248e-05,
"epoch": 1.9686621132985134,
"step": 4900
},
{
"loss": 0.020532915592193602,
"grad_norm": 0.6522228121757507,
"learning_rate": 9.201227441361526e-05,
"epoch": 1.9887505022097227,
"step": 4950
},
{
"loss": 0.019961978197097777,
"grad_norm": 0.8586557507514954,
"learning_rate": 9.183680502241903e-05,
"epoch": 2.008838891120932,
"step": 5000
},
{
"eval_seen_loss": 0.021278277039527893,
"eval_seen_accuracy": 0.9948671497584541,
"eval_seen_f1_valid": 0.9959962317475272,
"eval_seen_f1_invalid": 0.9928511354079058,
"eval_seen_macro_f1": 0.9944236835777165,
"eval_seen_majority_baseline": 0.6400966183574879,
"eval_seen_runtime": 0.3206,
"eval_seen_samples_per_second": 20661.243,
"eval_seen_steps_per_second": 162.196,
"epoch": 2.008838891120932,
"step": 5000
},
{
"eval_unseen_loss": 0.09243584424257278,
"eval_unseen_accuracy": 0.9835446859903382,
"eval_unseen_f1_valid": 0.9871930442956174,
"eval_unseen_f1_invalid": 0.9769896559003589,
"eval_unseen_macro_f1": 0.9820913500979882,
"eval_unseen_majority_baseline": 0.6400966183574879,
"eval_unseen_runtime": 0.3179,
"eval_unseen_samples_per_second": 20837.542,
"eval_unseen_steps_per_second": 163.58,
"epoch": 2.008838891120932,
"step": 5000
},
{
"loss": 0.014057793617248536,
"grad_norm": 0.0803026631474495,
"learning_rate": 9.165960033683031e-05,
"epoch": 2.0289272800321414,
"step": 5050
},
{
"loss": 0.01633061408996582,
"grad_norm": 0.020075250416994095,
"learning_rate": 9.148066770689166e-05,
"epoch": 2.0490156689433507,
"step": 5100
},
{
"loss": 0.006894637346267701,
"grad_norm": 0.011754917912185192,
"learning_rate": 9.130001455431676e-05,
"epoch": 2.06910405785456,
"step": 5150
},
{
"loss": 0.01216249942779541,
"grad_norm": 0.0178280808031559,
"learning_rate": 9.111764837218267e-05,
"epoch": 2.0891924467657694,
"step": 5200
},
{
"loss": 0.013817080259323121,
"grad_norm": 0.03707554191350937,
"learning_rate": 9.093357672461894e-05,
"epoch": 2.1092808356769788,
"step": 5250
},
{
"loss": 0.004771507978439331,
"grad_norm": 0.30397188663482666,
"learning_rate": 9.07478072464939e-05,
"epoch": 2.129369224588188,
"step": 5300
},
{
"loss": 0.006007364988327026,
"grad_norm": 0.031365204602479935,
"learning_rate": 9.056034764309797e-05,
"epoch": 2.1494576134993975,
"step": 5350
},
{
"loss": 0.00949288547039032,
"grad_norm": 0.02746967040002346,
"learning_rate": 9.037120568982412e-05,
"epoch": 2.169546002410607,
"step": 5400
},
{
"loss": 0.01284904956817627,
"grad_norm": 0.2411639392375946,
"learning_rate": 9.018038923184529e-05,
"epoch": 2.189634391321816,
"step": 5450
},
{
"loss": 0.00634078323841095,
"grad_norm": 0.06414932012557983,
"learning_rate": 8.998790618378901e-05,
"epoch": 2.2097227802330255,
"step": 5500
},
{
"eval_seen_loss": 0.010500301606953144,
"eval_seen_accuracy": 0.9977355072463768,
"eval_seen_f1_valid": 0.9982321744254568,
"eval_seen_f1_invalid": 0.9968507243334034,
"eval_seen_macro_f1": 0.9975414493794301,
"eval_seen_majority_baseline": 0.6400966183574879,
"eval_seen_runtime": 0.3278,
"eval_seen_samples_per_second": 20206.163,
"eval_seen_steps_per_second": 158.623,
"epoch": 2.2097227802330255,
"step": 5500
},
{
"eval_unseen_loss": 0.0262172669172287,
"eval_unseen_accuracy": 0.9923007246376812,
"eval_unseen_f1_valid": 0.9940007057993177,
"eval_unseen_f1_invalid": 0.9892563724457551,
"eval_unseen_macro_f1": 0.9916285391225363,
"eval_unseen_majority_baseline": 0.6400966183574879,
"eval_unseen_runtime": 0.297,
"eval_unseen_samples_per_second": 22302.588,
"eval_unseen_steps_per_second": 175.081,
"epoch": 2.2097227802330255,
"step": 5500
},
{
"loss": 0.012844257354736328,
"grad_norm": 0.03905527666211128,
"learning_rate": 8.979376452940917e-05,
"epoch": 2.229811169144235,
"step": 5550
},
{
"loss": 0.008379681706428528,
"grad_norm": 0.00931452214717865,
"learning_rate": 8.959797232125479e-05,
"epoch": 2.2498995580554437,
"step": 5600
},
{
"loss": 0.009271252155303954,
"grad_norm": 2.55387020111084,
"learning_rate": 8.940053768033609e-05,
"epoch": 2.269987946966653,
"step": 5650
},
{
"loss": 0.015088608264923095,
"grad_norm": 0.033489350229501724,
"learning_rate": 8.920146879578765e-05,
"epoch": 2.2900763358778624,
"step": 5700
},
{
"loss": 0.007871510982513428,
"grad_norm": 0.021451091393828392,
"learning_rate": 8.900077392452864e-05,
"epoch": 2.3101647247890718,
"step": 5750
},
{
"loss": 0.0116357684135437,
"grad_norm": 1.7073649168014526,
"learning_rate": 8.879846139092045e-05,
"epoch": 2.330253113700281,
"step": 5800
},
{
"loss": 0.010076509714126587,
"grad_norm": 0.07575485110282898,
"learning_rate": 8.859453958642143e-05,
"epoch": 2.3503415026114904,
"step": 5850
},
{
"loss": 0.008153905868530273,
"grad_norm": 0.03403827175498009,
"learning_rate": 8.838901696923871e-05,
"epoch": 2.3704298915227,
"step": 5900
},
{
"loss": 0.002156134098768234,
"grad_norm": 0.05620236694812775,
"learning_rate": 8.818190206397749e-05,
"epoch": 2.390518280433909,
"step": 5950
},
{
"loss": 0.013041321039199829,
"grad_norm": 0.019352883100509644,
"learning_rate": 8.797320346128739e-05,
"epoch": 2.4106066693451185,
"step": 6000
},
{
"eval_seen_loss": 0.01673523522913456,
"eval_seen_accuracy": 0.9953200483091788,
"eval_seen_f1_valid": 0.9963395914511749,
"eval_seen_f1_invalid": 0.993513287298598,
"eval_seen_macro_f1": 0.9949264393748865,
"eval_seen_majority_baseline": 0.6400966183574879,
"eval_seen_runtime": 0.3192,
"eval_seen_samples_per_second": 20749.181,
"eval_seen_steps_per_second": 162.886,
"epoch": 2.4106066693451185,
"step": 6000
},
{
"eval_unseen_loss": 0.06512533873319626,
"eval_unseen_accuracy": 0.9859601449275363,
"eval_unseen_f1_valid": 0.98898756660746,
"eval_unseen_f1_invalid": 0.9806371018113679,
"eval_unseen_macro_f1": 0.9848123342094139,
"eval_unseen_majority_baseline": 0.6400966183574879,
"eval_unseen_runtime": 0.3039,
"eval_unseen_samples_per_second": 21795.481,
"eval_unseen_steps_per_second": 171.1,
"epoch": 2.4106066693451185,
"step": 6000
},
{
"loss": 0.011934045553207397,
"grad_norm": 3.0569326877593994,
"learning_rate": 8.776292981750618e-05,
"epoch": 2.430695058256328,
"step": 6050
},
{
"loss": 0.009842355251312256,
"grad_norm": 0.011145714670419693,
"learning_rate": 8.755108985430068e-05,
"epoch": 2.450783447167537,
"step": 6100
},
{
"loss": 0.006759999990463257,
"grad_norm": 0.12077642232179642,
"learning_rate": 8.73376923583051e-05,
"epoch": 2.4708718360787465,
"step": 6150
},
{
"loss": 0.014839231967926025,
"grad_norm": 0.04140232875943184,
"learning_rate": 8.712274618075641e-05,
"epoch": 2.490960224989956,
"step": 6200
},
{
"loss": 0.016083663702011107,
"grad_norm": 0.03823714703321457,
"learning_rate": 8.690626023712743e-05,
"epoch": 2.511048613901165,
"step": 6250
},
{
"loss": 0.011055660247802735,
"grad_norm": 6.6721906661987305,
"learning_rate": 8.668824350675691e-05,
"epoch": 2.5311370028123745,
"step": 6300
},
{
"loss": 0.01400442361831665,
"grad_norm": 25.896717071533203,
"learning_rate": 8.646870503247709e-05,
"epoch": 2.551225391723584,
"step": 6350
},
{
"loss": 0.009680263996124268,
"grad_norm": 0.026539063081145287,
"learning_rate": 8.624765392023864e-05,
"epoch": 2.571313780634793,
"step": 6400
},
{
"loss": 0.011566929817199707,
"grad_norm": 0.14755235612392426,
"learning_rate": 8.602509933873302e-05,
"epoch": 2.5914021695460026,
"step": 6450
},
{
"loss": 0.008653899431228637,
"grad_norm": 0.025059988722205162,
"learning_rate": 8.580105051901206e-05,
"epoch": 2.611490558457212,
"step": 6500
},
{
"eval_seen_loss": 0.014686978422105312,
"eval_seen_accuracy": 0.996225845410628,
"eval_seen_f1_valid": 0.9970515390965916,
"eval_seen_f1_invalid": 0.9947578108618159,
"eval_seen_macro_f1": 0.9959046749792038,
"eval_seen_majority_baseline": 0.6400966183574879,
"eval_seen_runtime": 0.3206,
"eval_seen_samples_per_second": 20658.477,
"eval_seen_steps_per_second": 162.174,
"epoch": 2.611490558457212,
"step": 6500
},
{
"eval_unseen_loss": 0.040618833154439926,
"eval_unseen_accuracy": 0.9883756038647343,
"eval_unseen_f1_valid": 0.9909379781099212,
"eval_unseen_f1_invalid": 0.983792885708272,
"eval_unseen_macro_f1": 0.9873654319090965,
"eval_unseen_majority_baseline": 0.6400966183574879,
"eval_unseen_runtime": 0.3276,
"eval_unseen_samples_per_second": 20220.354,
"eval_unseen_steps_per_second": 158.735,
"epoch": 2.611490558457212,
"step": 6500
},
{
"loss": 0.017121171951293944,
"grad_norm": 1.6399306058883667,
"learning_rate": 8.557551675410521e-05,
"epoch": 2.6315789473684212,
"step": 6550
},
{
"loss": 0.01153093457221985,
"grad_norm": 0.0197468101978302,
"learning_rate": 8.534850739863402e-05,
"epoch": 2.6516673362796306,
"step": 6600
},
{
"loss": 0.005534862875938415,
"grad_norm": 0.011156822554767132,
"learning_rate": 8.512003186842414e-05,
"epoch": 2.67175572519084,
"step": 6650
},
{
"loss": 0.0065694618225097656,
"grad_norm": 0.007382044102996588,
"learning_rate": 8.489009964011476e-05,
"epoch": 2.6918441141020493,
"step": 6700
},
{
"loss": 0.004922803938388825,
"grad_norm": 0.023747533559799194,
"learning_rate": 8.465872025076557e-05,
"epoch": 2.7119325030132586,
"step": 6750
},
{
"loss": 0.004972059428691864,
"grad_norm": 0.1991339474916458,
"learning_rate": 8.442590329746114e-05,
"epoch": 2.7320208919244675,
"step": 6800
},
{
"loss": 0.00948186993598938,
"grad_norm": 0.018709462136030197,
"learning_rate": 8.419165843691292e-05,
"epoch": 2.752109280835677,
"step": 6850
},
{
"loss": 0.017984031438827514,
"grad_norm": 0.04365852475166321,
"learning_rate": 8.395599538505867e-05,
"epoch": 2.772197669746886,
"step": 6900
},
{
"loss": 0.010866541862487793,
"grad_norm": 3.3207244873046875,
"learning_rate": 8.371892391665942e-05,
"epoch": 2.7922860586580955,
"step": 6950
},
{
"loss": 0.004931770861148834,
"grad_norm": 0.013545851223170757,
"learning_rate": 8.348045386489412e-05,
"epoch": 2.812374447569305,
"step": 7000
},
{
"eval_seen_loss": 0.016195246949791908,
"eval_seen_accuracy": 0.9965277777777778,
"eval_seen_f1_valid": 0.997288695037133,
"eval_seen_f1_invalid": 0.9951731374606506,
"eval_seen_macro_f1": 0.9962309162488918,
"eval_seen_majority_baseline": 0.6400966183574879,
"eval_seen_runtime": 0.3305,
"eval_seen_samples_per_second": 20041.803,
"eval_seen_steps_per_second": 157.333,
"epoch": 2.812374447569305,
"step": 7000
},
{
"eval_unseen_loss": 0.034073229879140854,
"eval_unseen_accuracy": 0.9930555555555556,
"eval_unseen_f1_valid": 0.9945639328763886,
"eval_unseen_f1_invalid": 0.9903886335144171,
"eval_unseen_macro_f1": 0.9924762831954028,
"eval_unseen_majority_baseline": 0.6400966183574879,
"eval_unseen_runtime": 0.2931,
"eval_unseen_samples_per_second": 22603.169,
"eval_unseen_steps_per_second": 177.44,
"epoch": 2.812374447569305,
"step": 7000
},
{
"loss": 0.016864250898361206,
"grad_norm": 0.03497542813420296,
"learning_rate": 8.32405951209517e-05,
"epoch": 2.8324628364805142,
"step": 7050
},
{
"loss": 0.011661477088928222,
"grad_norm": 0.1768326759338379,
"learning_rate": 8.29993576336209e-05,
"epoch": 2.8525512253917236,
"step": 7100
},
{
"loss": 0.00856854796409607,
"grad_norm": 0.01989070326089859,
"learning_rate": 8.275675140887748e-05,
"epoch": 2.872639614302933,
"step": 7150
},
{
"loss": 0.005270370841026306,
"grad_norm": 2.518010377883911,
"learning_rate": 8.251278650946938e-05,
"epoch": 2.8927280032141423,
"step": 7200
},
{
"loss": 0.01691861629486084,
"grad_norm": 0.013693725690245628,
"learning_rate": 8.226747305449918e-05,
"epoch": 2.9128163921253516,
"step": 7250
},
{
"loss": 0.011077804565429688,
"grad_norm": 0.05239178612828255,
"learning_rate": 8.202082121900441e-05,
"epoch": 2.932904781036561,
"step": 7300
},
{
"loss": 0.005902353525161743,
"grad_norm": 0.011177760548889637,
"learning_rate": 8.177284123353562e-05,
"epoch": 2.9529931699477703,
"step": 7350
},
{
"loss": 0.005208334922790527,
"grad_norm": 0.039729222655296326,
"learning_rate": 8.152354338373189e-05,
"epoch": 2.9730815588589796,
"step": 7400
},
{
"loss": 0.004365023374557495,
"grad_norm": 0.007116931024938822,
"learning_rate": 8.127293800989434e-05,
"epoch": 2.993169947770189,
"step": 7450
},
{
"loss": 0.004765605926513672,
"grad_norm": 0.04476737603545189,
"learning_rate": 8.102103550655718e-05,
"epoch": 3.0132583366813983,
"step": 7500
},
{
"eval_seen_loss": 0.01588328927755356,
"eval_seen_accuracy": 0.9954710144927537,
"eval_seen_f1_valid": 0.9964522232734153,
"eval_seen_f1_invalid": 0.9937395659432388,
"eval_seen_macro_f1": 0.995095894608327,
"eval_seen_majority_baseline": 0.6400966183574879,
"eval_seen_runtime": 0.3304,
"eval_seen_samples_per_second": 20050.206,
"eval_seen_steps_per_second": 157.399,
"epoch": 3.0132583366813983,
"step": 7500
},
{
"eval_unseen_loss": 0.10731399804353714,
"eval_unseen_accuracy": 0.9735809178743962,
"eval_unseen_f1_valid": 0.9791144527986633,
"eval_unseen_f1_invalid": 0.9640583281988088,
"eval_unseen_macro_f1": 0.9715863904987361,
"eval_unseen_majority_baseline": 0.6400966183574879,
"eval_unseen_runtime": 0.3153,
"eval_unseen_samples_per_second": 21009.724,
"eval_unseen_steps_per_second": 164.931,
"epoch": 3.0132583366813983,
"step": 7500
},
{
"loss": 0.002300529181957245,
"grad_norm": 0.5621789693832397,
"learning_rate": 8.076784632205647e-05,
"epoch": 3.0333467255926077,
"step": 7550
},
{
"loss": 0.007070068120956421,
"grad_norm": 0.015566053800284863,
"learning_rate": 8.0513380958097e-05,
"epoch": 3.053435114503817,
"step": 7600
},
{
"loss": 0.00422912985086441,
"grad_norm": 6.171871185302734,
"learning_rate": 8.025764996931638e-05,
"epoch": 3.073523503415026,
"step": 7650
},
{
"loss": 0.011097090244293213,
"grad_norm": 0.01741686835885048,
"learning_rate": 8.000066396284756e-05,
"epoch": 3.0936118923262352,
"step": 7700
},
{
"loss": 0.005830162763595581,
"grad_norm": 0.019328523427248,
"learning_rate": 7.974243359787865e-05,
"epoch": 3.1137002812374446,
"step": 7750
},
{
"loss": 0.0016254797577857972,
"grad_norm": 0.006262289825826883,
"learning_rate": 7.948296958521093e-05,
"epoch": 3.133788670148654,
"step": 7800
},
{
"loss": 0.005305635333061218,
"grad_norm": 0.0055910260416567326,
"learning_rate": 7.922228268681456e-05,
"epoch": 3.1538770590598633,
"step": 7850
},
{
"loss": 0.004000791013240814,
"grad_norm": 0.003951588179916143,
"learning_rate": 7.896038371538213e-05,
"epoch": 3.1739654479710726,
"step": 7900
},
{
"loss": 0.0049227488040924075,
"grad_norm": 0.007216272410005331,
"learning_rate": 7.869728353388026e-05,
"epoch": 3.194053836882282,
"step": 7950
},
{
"loss": 0.00094679094851017,
"grad_norm": 0.002421668032184243,
"learning_rate": 7.843299305509902e-05,
"epoch": 3.2141422257934913,
"step": 8000
},
{
"eval_seen_loss": 0.01580193266272545,
"eval_seen_accuracy": 0.9966787439613527,
"eval_seen_f1_valid": 0.9974044360547428,
"eval_seen_f1_invalid": 0.9953897736797988,
"eval_seen_macro_f1": 0.9963971048672708,
"eval_seen_majority_baseline": 0.6400966183574879,
"eval_seen_runtime": 0.3176,
"eval_seen_samples_per_second": 20857.221,
"eval_seen_steps_per_second": 163.734,
"epoch": 3.2141422257934913,
"step": 8000
},
{
"eval_unseen_loss": 0.028369244188070297,
"eval_unseen_accuracy": 0.9936594202898551,
"eval_unseen_f1_valid": 0.9950460014154282,
"eval_unseen_f1_invalid": 0.9911949685534591,
"eval_unseen_macro_f1": 0.9931204849844437,
"eval_unseen_majority_baseline": 0.6400966183574879,
"eval_unseen_runtime": 0.3103,
"eval_unseen_samples_per_second": 21345.059,
"eval_unseen_steps_per_second": 167.564,
"epoch": 3.2141422257934913,
"step": 8000
},
{
"loss": 0.010896263122558593,
"grad_norm": 0.00519702909514308,
"learning_rate": 7.816752324119924e-05,
"epoch": 3.2342306147047006,
"step": 8050
},
{
"loss": 0.003296748399734497,
"grad_norm": 0.0028257747180759907,
"learning_rate": 7.790088510325788e-05,
"epoch": 3.25431900361591,
"step": 8100
},
{
"loss": 0.006281962990760804,
"grad_norm": 0.0049965763464570045,
"learning_rate": 7.763308970081128e-05,
"epoch": 3.2744073925271193,
"step": 8150
},
{
"loss": 0.0040089207887649535,
"grad_norm": 0.004081875551491976,
"learning_rate": 7.736414814139645e-05,
"epoch": 3.2944957814383287,
"step": 8200
},
{
"loss": 0.00024588212370872496,
"grad_norm": 0.003750850446522236,
"learning_rate": 7.709407158009034e-05,
"epoch": 3.314584170349538,
"step": 8250
},
{
"loss": 0.0010862263292074203,
"grad_norm": 0.0021764510311186314,
"learning_rate": 7.682287121904721e-05,
"epoch": 3.3346725592607473,
"step": 8300
},
{
"loss": 0.005993441939353943,
"grad_norm": 0.003460386535152793,
"learning_rate": 7.655055830703391e-05,
"epoch": 3.3547609481719567,
"step": 8350
},
{
"loss": 0.003086153566837311,
"grad_norm": 0.021544523537158966,
"learning_rate": 7.627714413896331e-05,
"epoch": 3.374849337083166,
"step": 8400
},
{
"loss": 0.008029102087020875,
"grad_norm": 0.008518628776073456,
"learning_rate": 7.600264005542595e-05,
"epoch": 3.3949377259943754,
"step": 8450
},
{
"loss": 0.0035008740425109862,
"grad_norm": 0.0039153690449893475,
"learning_rate": 7.572705744221945e-05,
"epoch": 3.4150261149055847,
"step": 8500
},
{
"eval_seen_loss": 0.01266945619136095,
"eval_seen_accuracy": 0.997433574879227,
"eval_seen_f1_valid": 0.9979955193962976,
"eval_seen_f1_invalid": 0.9964338158170758,
"eval_seen_macro_f1": 0.9972146676066866,
"eval_seen_majority_baseline": 0.6400966183574879,
"eval_seen_runtime": 0.3186,
"eval_seen_samples_per_second": 20790.062,
"eval_seen_steps_per_second": 163.207,
"epoch": 3.4150261149055847,
"step": 8500
},
{
"eval_unseen_loss": 0.027893278747797012,
"eval_unseen_accuracy": 0.9921497584541062,
"eval_unseen_f1_valid": 0.9938592347661785,
"eval_unseen_f1_invalid": 0.9891213389121338,
"eval_unseen_macro_f1": 0.9914902868391562,
"eval_unseen_majority_baseline": 0.6400966183574879,
"eval_unseen_runtime": 0.3113,
"eval_unseen_samples_per_second": 21277.888,
"eval_unseen_steps_per_second": 167.037,
"epoch": 3.4150261149055847,
"step": 8500
},
{
"loss": 0.0038093182444572447,
"grad_norm": 0.00725920032709837,
"learning_rate": 7.545040772987641e-05,
"epoch": 3.435114503816794,
"step": 8550
},
{
"loss": 0.00811230182647705,
"grad_norm": 0.019070835784077644,
"learning_rate": 7.517270239319026e-05,
"epoch": 3.4552028927280034,
"step": 8600
},
{
"loss": 0.00710671603679657,
"grad_norm": 0.01030392199754715,
"learning_rate": 7.489395295073926e-05,
"epoch": 3.4752912816392127,
"step": 8650
},
{
"loss": 0.004966625869274139,
"grad_norm": 0.01758037507534027,
"learning_rate": 7.46141709644088e-05,
"epoch": 3.495379670550422,
"step": 8700
},
{
"loss": 0.008438785076141358,
"grad_norm": 0.02527831308543682,
"learning_rate": 7.433336803891177e-05,
"epoch": 3.5154680594616314,
"step": 8750
},
{
"loss": 0.004293153584003448,
"grad_norm": 0.28978201746940613,
"learning_rate": 7.405155582130736e-05,
"epoch": 3.5355564483728403,
"step": 8800
},
{
"loss": 0.008686498403549195,
"grad_norm": 0.004737816285341978,
"learning_rate": 7.376874600051778e-05,
"epoch": 3.5556448372840497,
"step": 8850
},
{
"loss": 0.0028849306702613832,
"grad_norm": 0.003080884926021099,
"learning_rate": 7.348495030684358e-05,
"epoch": 3.575733226195259,
"step": 8900
},
{
"loss": 0.00820321500301361,
"grad_norm": 0.014155007898807526,
"learning_rate": 7.320018051147699e-05,
"epoch": 3.5958216151064684,
"step": 8950
},
{
"loss": 0.0075477021932601925,
"grad_norm": 0.8712772727012634,
"learning_rate": 7.291444842601382e-05,
"epoch": 3.6159100040176777,
"step": 9000
},
{
"eval_seen_loss": 0.010590881109237671,
"eval_seen_accuracy": 0.997433574879227,
"eval_seen_f1_valid": 0.9979936268145875,
"eval_seen_f1_invalid": 0.9964397905759161,
"eval_seen_macro_f1": 0.9972167086952518,
"eval_seen_majority_baseline": 0.6400966183574879,
"eval_seen_runtime": 0.3229,
"eval_seen_samples_per_second": 20512.361,
"eval_seen_steps_per_second": 161.027,
"epoch": 3.6159100040176777,
"step": 9000
},
{
"eval_unseen_loss": 0.039689332246780396,
"eval_unseen_accuracy": 0.9910929951690821,
"eval_unseen_f1_valid": 0.9930465527401295,
"eval_unseen_f1_invalid": 0.9876128490447197,
"eval_unseen_macro_f1": 0.9903297008924246,
"eval_unseen_majority_baseline": 0.6400966183574879,
"eval_unseen_runtime": 0.3101,
"eval_unseen_samples_per_second": 21363.737,
"eval_unseen_steps_per_second": 167.71,
"epoch": 3.6159100040176777,
"step": 9000
},
{
"loss": 0.00436368465423584,
"grad_norm": 0.0035482132807374,
"learning_rate": 7.26277659019634e-05,
"epoch": 3.635998392928887,
"step": 9050
},
{
"loss": 0.009257551431655884,
"grad_norm": 0.026822760701179504,
"learning_rate": 7.234014483025708e-05,
"epoch": 3.6560867818400964,
"step": 9100
},
{
"loss": 0.004030225574970245,
"grad_norm": 0.01450075302273035,
"learning_rate": 7.205159714075501e-05,
"epoch": 3.6761751707513057,
"step": 9150
},
{
"loss": 0.005230934023857116,
"grad_norm": 0.034596361219882965,
"learning_rate": 7.176213480175129e-05,
"epoch": 3.696263559662515,
"step": 9200
},
{
"loss": 0.004835358262062073,
"grad_norm": 0.014685052447021008,
"learning_rate": 7.147176981947761e-05,
"epoch": 3.7163519485737244,
"step": 9250
},
{
"loss": 0.0010214821994304656,
"grad_norm": 0.01088032592087984,
"learning_rate": 7.118051423760521e-05,
"epoch": 3.7364403374849338,
"step": 9300
},
{
"loss": 0.0020134617388248444,
"grad_norm": 0.0023934361524879932,
"learning_rate": 7.088838013674537e-05,
"epoch": 3.756528726396143,
"step": 9350
},
{
"loss": 0.011201596260070801,
"grad_norm": 0.051524143666028976,
"learning_rate": 7.059537963394827e-05,
"epoch": 3.7766171153073524,
"step": 9400
},
{
"loss": 0.011317558288574218,
"grad_norm": 0.04817855358123779,
"learning_rate": 7.030152488220052e-05,
"epoch": 3.796705504218562,
"step": 9450
},
{
"loss": 0.007253561615943909,
"grad_norm": 0.05064212903380394,
"learning_rate": 7.000682806992094e-05,
"epoch": 3.816793893129771,
"step": 9500
},
{
"eval_seen_loss": 0.015345041640102863,
"eval_seen_accuracy": 0.996225845410628,
"eval_seen_f1_valid": 0.9970473603401441,
"eval_seen_f1_invalid": 0.9947709684166491,
"eval_seen_macro_f1": 0.9959091643783966,
"eval_seen_majority_baseline": 0.6400966183574879,
"eval_seen_runtime": 0.3207,
"eval_seen_samples_per_second": 20651.644,
"eval_seen_steps_per_second": 162.12,
"epoch": 3.816793893129771,
"step": 9500
},
{
"eval_unseen_loss": 0.06220504641532898,
"eval_unseen_accuracy": 0.9889794685990339,
"eval_unseen_f1_valid": 0.9913640127765291,
"eval_unseen_f1_invalid": 0.9847758081334724,
"eval_unseen_macro_f1": 0.9880699104550008,
"eval_unseen_majority_baseline": 0.6400966183574879,
"eval_unseen_runtime": 0.3133,
"eval_unseen_samples_per_second": 21143.712,
"eval_unseen_steps_per_second": 165.983,
"epoch": 3.816793893129771,
"step": 9500
},
{
"loss": 0.0028853157162666322,
"grad_norm": 0.02075340412557125,
"learning_rate": 6.97113014204551e-05,
"epoch": 3.8368822820409805,
"step": 9550
},
{
"loss": 0.010675743818283082,
"grad_norm": 0.03223203495144844,
"learning_rate": 6.941495719156834e-05,
"epoch": 3.8569706709521894,
"step": 9600
},
{
"loss": 0.005665901899337768,
"grad_norm": 0.0044933464378118515,
"learning_rate": 6.911780767493729e-05,
"epoch": 3.8770590598633987,
"step": 9650
},
{
"loss": 0.007787343263626099,
"grad_norm": 9.683483123779297,
"learning_rate": 6.881986519564006e-05,
"epoch": 3.897147448774608,
"step": 9700
},
{
"loss": 0.009898404479026795,
"grad_norm": 5.278289318084717,
"learning_rate": 6.852114211164502e-05,
"epoch": 3.9172358376858174,
"step": 9750
},
{
"loss": 0.0028400224447250365,
"grad_norm": 0.006490530911833048,
"learning_rate": 6.822165081329826e-05,
"epoch": 3.9373242265970267,
"step": 9800
},
{
"loss": 0.002898951768875122,
"grad_norm": 2.960984230041504,
"learning_rate": 6.79214037228096e-05,
"epoch": 3.957412615508236,
"step": 9850
},
{
"loss": 0.00907094955444336,
"grad_norm": 0.04198857396841049,
"learning_rate": 6.762041329373739e-05,
"epoch": 3.9775010044194454,
"step": 9900
},
{
"loss": 0.006905393600463867,
"grad_norm": 0.14619038999080658,
"learning_rate": 6.731869201047192e-05,
"epoch": 3.9975893933306548,
"step": 9950
},
{
"loss": 0.009627650380134583,
"grad_norm": 0.016034724190831184,
"learning_rate": 6.701625238771774e-05,
"epoch": 4.017677782241864,
"step": 10000
},
{
"eval_seen_loss": 0.011894118040800095,
"eval_seen_accuracy": 0.9969806763285024,
"eval_seen_f1_valid": 0.9976403964134026,
"eval_seen_f1_invalid": 0.9958088851634533,
"eval_seen_macro_f1": 0.996724640788428,
"eval_seen_majority_baseline": 0.6400966183574879,
"eval_seen_runtime": 0.329,
"eval_seen_samples_per_second": 20131.157,
"eval_seen_steps_per_second": 158.034,
"epoch": 4.017677782241864,
"step": 10000
},
{
"eval_unseen_loss": 0.03878156840801239,
"eval_unseen_accuracy": 0.9882246376811594,
"eval_unseen_f1_valid": 0.9907866761162296,
"eval_unseen_f1_invalid": 0.983688833124216,
"eval_unseen_macro_f1": 0.9872377546202228,
"eval_unseen_majority_baseline": 0.6400966183574879,
"eval_unseen_runtime": 0.3023,
"eval_unseen_samples_per_second": 21913.894,
"eval_unseen_steps_per_second": 172.029,
"epoch": 4.017677782241864,
"step": 10000
},
{
"loss": 0.005427371263504028,
"grad_norm": 0.005436044652014971,
"learning_rate": 6.67131069699743e-05,
"epoch": 4.0377661711530735,
"step": 10050
},
{
"loss": 0.0034640106558799745,
"grad_norm": 0.06325726956129074,
"learning_rate": 6.640926833101597e-05,
"epoch": 4.057854560064283,
"step": 10100
},
{
"loss": 0.0027718636393547057,
"grad_norm": 0.0038235979154706,
"learning_rate": 6.610474907337023e-05,
"epoch": 4.077942948975492,
"step": 10150
},
{
"loss": 0.0030018627643585206,
"grad_norm": 0.005502292420715094,
"learning_rate": 6.579956182779509e-05,
"epoch": 4.0980313378867015,
"step": 10200
},
{
"loss": 0.006214578151702881,
"grad_norm": 0.006388835608959198,
"learning_rate": 6.549371925275516e-05,
"epoch": 4.118119726797911,
"step": 10250
},
{
"loss": 0.004299657046794891,
"grad_norm": 0.02509908750653267,
"learning_rate": 6.518723403389662e-05,
"epoch": 4.13820811570912,
"step": 10300
},
{
"loss": 0.0021544244885444643,
"grad_norm": 0.004356733988970518,
"learning_rate": 6.488011888352102e-05,
"epoch": 4.1582965046203295,
"step": 10350
},
{
"loss": 0.002441017180681229,
"grad_norm": 0.012465689331293106,
"learning_rate": 6.457238654005805e-05,
"epoch": 4.178384893531539,
"step": 10400
},
{
"loss": 0.005048474669456482,
"grad_norm": 0.0057596489787101746,
"learning_rate": 6.42640497675371e-05,
"epoch": 4.198473282442748,
"step": 10450
},
{
"loss": 0.0016454234719276428,
"grad_norm": 0.752906322479248,
"learning_rate": 6.395512135505794e-05,
"epoch": 4.2185616713539575,
"step": 10500
},
{
"eval_seen_loss": 0.021507009863853455,
"eval_seen_accuracy": 0.9957729468599034,
"eval_seen_f1_valid": 0.9967004477963705,
"eval_seen_f1_invalid": 0.994120117597648,
"eval_seen_macro_f1": 0.9954102826970093,
"eval_seen_majority_baseline": 0.6400966183574879,
"eval_seen_runtime": 0.315,
"eval_seen_samples_per_second": 21030.908,
"eval_seen_steps_per_second": 165.098,
"epoch": 4.2185616713539575,
"step": 10500
},
{
"eval_unseen_loss": 0.04845276474952698,
"eval_unseen_accuracy": 0.9897342995169082,
"eval_unseen_f1_valid": 0.9919488515273502,
"eval_unseen_f1_invalid": 0.9858392336526446,
"eval_unseen_macro_f1": 0.9888940425899975,
"eval_unseen_majority_baseline": 0.6400966183574879,
"eval_unseen_runtime": 0.31,
"eval_unseen_samples_per_second": 21366.218,
"eval_unseen_steps_per_second": 167.73,
"epoch": 4.2185616713539575,
"step": 10500
},
{
"loss": 0.00538996934890747,
"grad_norm": 0.0065927463583648205,
"learning_rate": 6.364561411626013e-05,
"epoch": 4.238650060265167,
"step": 10550
},
{
"loss": 0.0015137888491153716,
"grad_norm": 0.12535056471824646,
"learning_rate": 6.333554088879173e-05,
"epoch": 4.258738449176376,
"step": 10600
},
{
"loss": 0.005469639897346497,
"grad_norm": 0.1713482290506363,
"learning_rate": 6.302491453377655e-05,
"epoch": 4.278826838087586,
"step": 10650
},
{
"loss": 0.0035777607560157775,
"grad_norm": 0.0622786246240139,
"learning_rate": 6.271374793528103e-05,
"epoch": 4.298915226998795,
"step": 10700
},
{
"loss": 0.0011316427588462829,
"grad_norm": 0.0019172088941559196,
"learning_rate": 6.240205399977955e-05,
"epoch": 4.319003615910004,
"step": 10750
},
{
"loss": 0.0026168256998062136,
"grad_norm": 0.005300440359860659,
"learning_rate": 6.208984565561921e-05,
"epoch": 4.339092004821214,
"step": 10800
},
{
"loss": 0.006189553141593933,
"grad_norm": 0.005188933108001947,
"learning_rate": 6.17771358524837e-05,
"epoch": 4.359180393732423,
"step": 10850
},
{
"loss": 0.008901360034942627,
"grad_norm": 0.0037269098684191704,
"learning_rate": 6.146393756085595e-05,
"epoch": 4.379268782643632,
"step": 10900
},
{
"loss": 0.0011978115141391755,
"grad_norm": 0.004762765485793352,
"learning_rate": 6.115026377148037e-05,
"epoch": 4.399357171554842,
"step": 10950
},
{
"loss": 0.0011883687973022461,
"grad_norm": 0.0023202828597277403,
"learning_rate": 6.083612749482388e-05,
"epoch": 4.419445560466051,
"step": 11000
},
{
"eval_seen_loss": 0.008558264002203941,
"eval_seen_accuracy": 0.9980374396135265,
"eval_seen_f1_valid": 0.9984664385985609,
"eval_seen_f1_invalid": 0.9972752043596731,
"eval_seen_macro_f1": 0.997870821479117,
"eval_seen_majority_baseline": 0.6400966183574879,
"eval_seen_runtime": 0.3239,
"eval_seen_samples_per_second": 20450.306,
"eval_seen_steps_per_second": 160.54,
"epoch": 4.419445560466051,
"step": 11000
},
{
"eval_unseen_loss": 0.0422622486948967,
"eval_unseen_accuracy": 0.9889794685990339,
"eval_unseen_f1_valid": 0.9913353115727003,
"eval_unseen_f1_invalid": 0.9848641924113622,
"eval_unseen_macro_f1": 0.9880997519920313,
"eval_unseen_majority_baseline": 0.6400966183574879,
"eval_unseen_runtime": 0.2973,
"eval_unseen_samples_per_second": 22280.875,
"eval_unseen_steps_per_second": 174.91,
"epoch": 4.419445560466051,
"step": 11000
},
{
"loss": 0.003962970674037934,
"grad_norm": 0.006651753559708595,
"learning_rate": 6.052154176053626e-05,
"epoch": 4.43953394937726,
"step": 11050
},
{
"loss": 0.000864512175321579,
"grad_norm": 0.009494757279753685,
"learning_rate": 6.0206519616909876e-05,
"epoch": 4.45962233828847,
"step": 11100
},
{
"loss": 0.00789304792881012,
"grad_norm": 0.003297999268397689,
"learning_rate": 5.9891074130338207e-05,
"epoch": 4.479710727199679,
"step": 11150
},
{
"loss": 0.0034743845462799072,
"grad_norm": 0.009166165255010128,
"learning_rate": 5.957521838477414e-05,
"epoch": 4.4997991161108875,
"step": 11200
},
{
"loss": 0.004978830218315125,
"grad_norm": 0.0029759351164102554,
"learning_rate": 5.9258965481187126e-05,
"epoch": 4.519887505022098,
"step": 11250
},
{
"loss": 0.0007813534885644913,
"grad_norm": 0.023890171200037003,
"learning_rate": 5.8942328537019766e-05,
"epoch": 4.539975893933306,
"step": 11300
},
{
"loss": 0.0031626516580581664,
"grad_norm": 0.0044487579725682735,
"learning_rate": 5.8625320685643834e-05,
"epoch": 4.5600642828445155,
"step": 11350
},
{
"loss": 0.0036859130859375,
"grad_norm": 0.022548481822013855,
"learning_rate": 5.83079550758155e-05,
"epoch": 4.580152671755725,
"step": 11400
},
{
"loss": 0.0005728846788406372,
"grad_norm": 0.0019822390750050545,
"learning_rate": 5.799024487112986e-05,
"epoch": 4.600241060666934,
"step": 11450
},
{
"loss": 0.005244595408439637,
"grad_norm": 0.0025443369522690773,
"learning_rate": 5.767220324947509e-05,
"epoch": 4.6203294495781435,
"step": 11500
},
{
"eval_seen_loss": 0.007967733778059483,
"eval_seen_accuracy": 0.9981884057971014,
"eval_seen_f1_valid": 0.9985852393303466,
"eval_seen_f1_invalid": 0.9974821653378095,
"eval_seen_macro_f1": 0.9980337023340781,
"eval_seen_majority_baseline": 0.6400966183574879,
"eval_seen_runtime": 0.3207,
"eval_seen_samples_per_second": 20651.598,
"eval_seen_steps_per_second": 162.12,
"epoch": 4.6203294495781435,
"step": 11500
},
{
"eval_unseen_loss": 0.02163851074874401,
"eval_unseen_accuracy": 0.9939613526570048,
"eval_unseen_f1_valid": 0.9952852428099952,
"eval_unseen_f1_invalid": 0.9916036943744752,
"eval_unseen_macro_f1": 0.9934444685922352,
"eval_unseen_majority_baseline": 0.6400966183574879,
"eval_unseen_runtime": 0.2963,
"eval_unseen_samples_per_second": 22358.064,
"eval_unseen_steps_per_second": 175.516,
"epoch": 4.6203294495781435,
"step": 11500
},
{
"loss": 0.0024283653497695922,
"grad_norm": 0.002546750009059906,
"learning_rate": 5.735384340248569e-05,
"epoch": 4.640417838489353,
"step": 11550
},
{
"loss": 0.007456202507019043,
"grad_norm": 0.0035354087594896555,
"learning_rate": 5.703517853499553e-05,
"epoch": 4.660506227400562,
"step": 11600
},
{
"loss": 0.0023691913485527037,
"grad_norm": 4.495802402496338,
"learning_rate": 5.671622186448989e-05,
"epoch": 4.6805946163117715,
"step": 11650
},
{
"loss": 0.002830646634101868,
"grad_norm": 0.0077832662500441074,
"learning_rate": 5.639698662055751e-05,
"epoch": 4.700683005222981,
"step": 11700
},
{
"loss": 0.0030017268657684328,
"grad_norm": 0.018308039754629135,
"learning_rate": 5.607748604434161e-05,
"epoch": 4.72077139413419,
"step": 11750
},
{
"loss": 0.00012694787234067916,
"grad_norm": 0.0019742785952985287,
"learning_rate": 5.575773338799083e-05,
"epoch": 4.7408597830454,
"step": 11800
},
{
"loss": 0.003408160209655762,
"grad_norm": 0.0017532280180603266,
"learning_rate": 5.5437741914109485e-05,
"epoch": 4.760948171956609,
"step": 11850
},
{
"loss": 0.0006748394668102264,
"grad_norm": 0.009566946886479855,
"learning_rate": 5.511752489520753e-05,
"epoch": 4.781036560867818,
"step": 11900
},
{
"loss": 0.0019586144387722017,
"grad_norm": 0.003580181859433651,
"learning_rate": 5.4797095613149983e-05,
"epoch": 4.801124949779028,
"step": 11950
},
{
"loss": 0.006813893914222717,
"grad_norm": 0.016823643818497658,
"learning_rate": 5.4476467358606044e-05,
"epoch": 4.821213338690237,
"step": 12000
},
{
"eval_seen_loss": 0.011064874939620495,
"eval_seen_accuracy": 0.9972826086956522,
"eval_seen_f1_valid": 0.99787785899552,
"eval_seen_f1_invalid": 0.9962232480067142,
"eval_seen_macro_f1": 0.9970505535011172,
"eval_seen_majority_baseline": 0.6400966183574879,
"eval_seen_runtime": 0.3175,
"eval_seen_samples_per_second": 20860.995,
"eval_seen_steps_per_second": 163.764,
"epoch": 4.821213338690237,
"step": 12000
},
{
"eval_unseen_loss": 0.051994677633047104,
"eval_unseen_accuracy": 0.9859601449275363,
"eval_unseen_f1_valid": 0.9889953851615193,
"eval_unseen_f1_invalid": 0.9806128830519075,
"eval_unseen_macro_f1": 0.9848041341067134,
"eval_unseen_majority_baseline": 0.6400966183574879,
"eval_unseen_runtime": 0.3132,
"eval_unseen_samples_per_second": 21152.179,
"eval_unseen_steps_per_second": 166.05,
"epoch": 4.821213338690237,
"step": 12000
},
{
"loss": 0.0032321390509605407,
"grad_norm": 0.00454537570476532,
"learning_rate": 5.415565343049785e-05,
"epoch": 4.841301727601446,
"step": 12050
},
{
"loss": 0.0032006219029426576,
"grad_norm": 6.071142673492432,
"learning_rate": 5.383466713544886e-05,
"epoch": 4.861390116512656,
"step": 12100
},
{
"loss": 0.00025400251150131225,
"grad_norm": 0.0011727007804438472,
"learning_rate": 5.351352178723186e-05,
"epoch": 4.881478505423865,
"step": 12150
},
{
"loss": 0.002920109033584595,
"grad_norm": 0.01371962670236826,
"learning_rate": 5.319223070621688e-05,
"epoch": 4.901566894335074,
"step": 12200
},
{
"loss": 0.00021828394383192063,
"grad_norm": 0.0007112867897376418,
"learning_rate": 5.287080721881854e-05,
"epoch": 4.921655283246284,
"step": 12250
},
{
"loss": 0.0014558228850364684,
"grad_norm": 0.001511621754616499,
"learning_rate": 5.254926465694341e-05,
"epoch": 4.941743672157493,
"step": 12300
},
{
"loss": 0.005796372890472412,
"grad_norm": 0.20507988333702087,
"learning_rate": 5.222761635743697e-05,
"epoch": 4.961832061068702,
"step": 12350
},
{
"loss": 0.005083301663398742,
"grad_norm": 0.0018521308666095138,
"learning_rate": 5.190587566153049e-05,
"epoch": 4.981920449979912,
"step": 12400
},
{
"loss": 0.0006556917726993561,
"grad_norm": 0.0016021252376958728,
"learning_rate": 5.15840559142876e-05,
"epoch": 5.002008838891121,
"step": 12450
},
{
"loss": 0.0015148460865020753,
"grad_norm": 0.0033229379914700985,
"learning_rate": 5.12621704640508e-05,
"epoch": 5.02209722780233,
"step": 12500
},
{
"eval_seen_loss": 0.016905121505260468,
"eval_seen_accuracy": 0.996225845410628,
"eval_seen_f1_valid": 0.997052929388188,
"eval_seen_f1_invalid": 0.994753410283316,
"eval_seen_macro_f1": 0.995903169835752,
"eval_seen_majority_baseline": 0.6400966183574879,
"eval_seen_runtime": 0.3193,
"eval_seen_samples_per_second": 20747.708,
"eval_seen_steps_per_second": 162.875,
"epoch": 5.02209722780233,
"step": 12500
},
{
"eval_unseen_loss": 0.08490641415119171,
"eval_unseen_accuracy": 0.9846014492753623,
"eval_unseen_f1_valid": 0.9879232772910254,
"eval_unseen_f1_invalid": 0.9787588504789672,
"eval_unseen_macro_f1": 0.9833410638849962,
"eval_unseen_majority_baseline": 0.6400966183574879,
"eval_unseen_runtime": 0.3059,
"eval_unseen_samples_per_second": 21657.606,
"eval_unseen_steps_per_second": 170.017,
"epoch": 5.02209722780233,
"step": 12500
},
{
"loss": 0.00185398668050766,
"grad_norm": 0.0010378584265708923,
"learning_rate": 5.09402326618878e-05,
"epoch": 5.04218561671354,
"step": 12550
},
{
"loss": 0.0015885192155838013,
"grad_norm": 0.0015575550496578217,
"learning_rate": 5.0618255861037776e-05,
"epoch": 5.062274005624749,
"step": 12600
},
{
"loss": 0.00361468642950058,
"grad_norm": 0.001530500827357173,
"learning_rate": 5.029625341635743e-05,
"epoch": 5.082362394535958,
"step": 12650
},
{
"loss": 7.036324590444565e-05,
"grad_norm": 0.0011731426930055022,
"learning_rate": 4.9974238683767154e-05,
"epoch": 5.102450783447168,
"step": 12700
},
{
"loss": 0.00022802915424108505,
"grad_norm": 0.0010616343934088945,
"learning_rate": 4.9652225019696986e-05,
"epoch": 5.122539172358377,
"step": 12750
},
{
"loss": 0.002062407433986664,
"grad_norm": 0.0012495917035266757,
"learning_rate": 4.9330225780532654e-05,
"epoch": 5.142627561269586,
"step": 12800
},
{
"loss": 0.0007111681997776032,
"grad_norm": 0.09994599968194962,
"learning_rate": 4.9008254322061595e-05,
"epoch": 5.162715950180796,
"step": 12850
},
{
"loss": 0.0007095547020435334,
"grad_norm": 0.0009567381348460913,
"learning_rate": 4.868632399891892e-05,
"epoch": 5.182804339092005,
"step": 12900
},
{
"loss": 6.402432918548585e-05,
"grad_norm": 0.0007548440480604768,
"learning_rate": 4.83644481640336e-05,
"epoch": 5.2028927280032145,
"step": 12950
},
{
"loss": 0.0011706628650426864,
"grad_norm": 0.0007474229787476361,
"learning_rate": 4.804264016807448e-05,
"epoch": 5.222981116914424,
"step": 13000
},
{
"eval_seen_loss": 0.007674613501876593,
"eval_seen_accuracy": 0.9981884057971014,
"eval_seen_f1_valid": 0.9985845718329796,
"eval_seen_f1_invalid": 0.9974842767295596,
"eval_seen_macro_f1": 0.9980344242812695,
"eval_seen_majority_baseline": 0.6400966183574879,
"eval_seen_runtime": 0.3285,
"eval_seen_samples_per_second": 20167.265,
"eval_seen_steps_per_second": 158.318,
"epoch": 5.222981116914424,
"step": 13000
},
{
"eval_unseen_loss": 0.06615690886974335,
"eval_unseen_accuracy": 0.9891304347826086,
"eval_unseen_f1_valid": 0.9914953933380581,
"eval_unseen_f1_invalid": 0.9849435382685069,
"eval_unseen_macro_f1": 0.9882194658032826,
"eval_unseen_majority_baseline": 0.6400966183574879,
"eval_unseen_runtime": 0.3195,
"eval_unseen_samples_per_second": 20734.098,
"eval_unseen_steps_per_second": 162.768,
"epoch": 5.222981116914424,
"step": 13000
},
{
"loss": 0.0001120208203792572,
"grad_norm": 0.0006617383914999664,
"learning_rate": 4.7720913358896704e-05,
"epoch": 5.243069505825633,
"step": 13050
},
{
"loss": 0.0048398998379707335,
"grad_norm": 0.39095479249954224,
"learning_rate": 4.739928108098789e-05,
"epoch": 5.2631578947368425,
"step": 13100
},
{
"loss": 0.0014353193342685699,
"grad_norm": 0.011521922424435616,
"learning_rate": 4.707775667491475e-05,
"epoch": 5.283246283648052,
"step": 13150
},
{
"loss": 0.0021208491921424866,
"grad_norm": 0.04535406082868576,
"learning_rate": 4.675635347676971e-05,
"epoch": 5.303334672559261,
"step": 13200
},
{
"loss": 0.0013151970505714417,
"grad_norm": 0.0014821949880570173,
"learning_rate": 4.6435084817617805e-05,
"epoch": 5.32342306147047,
"step": 13250
},
{
"loss": 3.317750990390778e-05,
"grad_norm": 0.003384900977835059,
"learning_rate": 4.611396402294364e-05,
"epoch": 5.34351145038168,
"step": 13300
},
{
"loss": 0.0002364267036318779,
"grad_norm": 0.0017969327745959163,
"learning_rate": 4.579300441209881e-05,
"epoch": 5.363599839292888,
"step": 13350
},
{
"loss": 0.0044511440396308895,
"grad_norm": 0.00422246940433979,
"learning_rate": 4.5472219297749306e-05,
"epoch": 5.383688228204098,
"step": 13400
},
{
"loss": 0.006281139850616455,
"grad_norm": 0.006894610356539488,
"learning_rate": 4.515162198532349e-05,
"epoch": 5.403776617115307,
"step": 13450
},
{
"loss": 0.005771521329879761,
"grad_norm": 0.0020705130882561207,
"learning_rate": 4.4831225772460045e-05,
"epoch": 5.423865006026516,
"step": 13500
},
{
"eval_seen_loss": 0.010174693539738655,
"eval_seen_accuracy": 0.9971316425120773,
"eval_seen_f1_valid": 0.9977586410286657,
"eval_seen_f1_invalid": 0.9960176063718298,
"eval_seen_macro_f1": 0.9968881237002478,
"eval_seen_majority_baseline": 0.6400966183574879,
"eval_seen_runtime": 0.3169,
"eval_seen_samples_per_second": 20903.498,
"eval_seen_steps_per_second": 164.098,
"epoch": 5.423865006026516,
"step": 13500
},
{
"eval_unseen_loss": 0.058374982327222824,
"eval_unseen_accuracy": 0.9894323671497585,
"eval_unseen_f1_valid": 0.99176664314279,
"eval_unseen_f1_invalid": 0.9852507374631267,
"eval_unseen_macro_f1": 0.9885086903029583,
"eval_unseen_majority_baseline": 0.6400966183574879,
"eval_unseen_runtime": 0.3043,
"eval_unseen_samples_per_second": 21769.42,
"eval_unseen_steps_per_second": 170.895,
"epoch": 5.423865006026516,
"step": 13500
},
{
"loss": 0.0006757942587137223,
"grad_norm": 0.004422497004270554,
"learning_rate": 4.451104394845656e-05,
"epoch": 5.443953394937726,
"step": 13550
},
{
"loss": 0.0002531594038009644,
"grad_norm": 0.001529279863461852,
"learning_rate": 4.419108979371825e-05,
"epoch": 5.464041783848935,
"step": 13600
},
{
"loss": 0.0036075374484062193,
"grad_norm": 0.006333576515316963,
"learning_rate": 4.387137657920714e-05,
"epoch": 5.484130172760144,
"step": 13650
},
{
"loss": 0.00012090455740690231,
"grad_norm": 0.0038246733602136374,
"learning_rate": 4.355191756589162e-05,
"epoch": 5.504218561671354,
"step": 13700
},
{
"loss": 0.001714312881231308,
"grad_norm": 0.005397704429924488,
"learning_rate": 4.323272600419636e-05,
"epoch": 5.524306950582563,
"step": 13750
},
{
"loss": 0.0036899104714393617,
"grad_norm": 5.890677452087402,
"learning_rate": 4.2913815133452775e-05,
"epoch": 5.544395339493772,
"step": 13800
},
{
"loss": 0.00011864371597766876,
"grad_norm": 0.0025099259801208973,
"learning_rate": 4.2595198181349906e-05,
"epoch": 5.564483728404982,
"step": 13850
},
{
"loss": 0.0008606189489364625,
"grad_norm": 0.0009816354140639305,
"learning_rate": 4.2276888363385654e-05,
"epoch": 5.584572117316191,
"step": 13900
},
{
"loss": 0.0009802313148975373,
"grad_norm": 0.0008119562990032136,
"learning_rate": 4.195889888231875e-05,
"epoch": 5.6046605062274,
"step": 13950
},
{
"loss": 0.0024506640434265137,
"grad_norm": 0.000700517965015024,
"learning_rate": 4.164124292762105e-05,
"epoch": 5.62474889513861,
"step": 14000
},
{
"eval_seen_loss": 0.009596684016287327,
"eval_seen_accuracy": 0.9978864734299517,
"eval_seen_f1_valid": 0.9983498349834984,
"eval_seen_f1_invalid": 0.9970612930310664,
"eval_seen_macro_f1": 0.9977055640072824,
"eval_seen_majority_baseline": 0.6400966183574879,
"eval_seen_runtime": 0.3205,
"eval_seen_samples_per_second": 20670.343,
"eval_seen_steps_per_second": 162.267,
"epoch": 5.62474889513861,
"step": 14000
},
{
"eval_unseen_loss": 0.08425682038068771,
"eval_unseen_accuracy": 0.9808272946859904,
"eval_unseen_f1_valid": 0.9849186557415984,
"eval_unseen_f1_invalid": 0.9736896623161384,
"eval_unseen_macro_f1": 0.9793041590288685,
"eval_unseen_majority_baseline": 0.6400966183574879,
"eval_unseen_runtime": 0.3167,
"eval_unseen_samples_per_second": 20912.766,
"eval_unseen_steps_per_second": 164.17,
"epoch": 5.62474889513861,
"step": 14000
},
{
"loss": 0.0036605629324913025,
"grad_norm": 0.00505917239934206,
"learning_rate": 4.1323933674930546e-05,
"epoch": 5.644837284049819,
"step": 14050
},
{
"loss": 0.0009563095867633819,
"grad_norm": 0.004556451458483934,
"learning_rate": 4.100698428550483e-05,
"epoch": 5.6649256729610284,
"step": 14100
},
{
"loss": 0.0005329408496618271,
"grad_norm": 0.0008073868812061846,
"learning_rate": 4.069040790567514e-05,
"epoch": 5.685014061872238,
"step": 14150
},
{
"loss": 0.0020050498843193054,
"grad_norm": 6.619334697723389,
"learning_rate": 4.0374217666301165e-05,
"epoch": 5.705102450783447,
"step": 14200
},
{
"loss": 0.006490317583084107,
"grad_norm": 0.0027281667571514845,
"learning_rate": 4.0058426682226404e-05,
"epoch": 5.7251908396946565,
"step": 14250
},
{
"loss": 0.0007787179946899414,
"grad_norm": 0.004724098369479179,
"learning_rate": 3.974304805173415e-05,
"epoch": 5.745279228605866,
"step": 14300
},
{
"loss": 3.9987266063690186e-05,
"grad_norm": 0.0007951312582008541,
"learning_rate": 3.942809485600417e-05,
"epoch": 5.765367617517075,
"step": 14350
},
{
"loss": 0.00021765440702438356,
"grad_norm": 0.008279331028461456,
"learning_rate": 3.911358015857023e-05,
"epoch": 5.7854560064282845,
"step": 14400
},
{
"loss": 0.003879154920578003,
"grad_norm": 0.1304825246334076,
"learning_rate": 3.879951700477821e-05,
"epoch": 5.805544395339494,
"step": 14450
},
{
"loss": 0.004461580812931061,
"grad_norm": 0.002032057149335742,
"learning_rate": 3.8485918421244934e-05,
"epoch": 5.825632784250703,
"step": 14500
},
{
"eval_seen_loss": 0.010054807178676128,
"eval_seen_accuracy": 0.9977355072463768,
"eval_seen_f1_valid": 0.9982305060752625,
"eval_seen_f1_invalid": 0.996856005030392,
"eval_seen_macro_f1": 0.9975432555528272,
"eval_seen_majority_baseline": 0.6400966183574879,
"eval_seen_runtime": 0.3332,
"eval_seen_samples_per_second": 19879.214,
"eval_seen_steps_per_second": 156.057,
"epoch": 5.825632784250703,
"step": 14500
},
{
"eval_unseen_loss": 0.07361596077680588,
"eval_unseen_accuracy": 0.9846014492753623,
"eval_unseen_f1_valid": 0.9879289940828402,
"eval_unseen_f1_invalid": 0.9787411421425594,
"eval_unseen_macro_f1": 0.9833350681126998,
"eval_unseen_majority_baseline": 0.6400966183574879,
"eval_unseen_runtime": 0.2998,
"eval_unseen_samples_per_second": 22098.303,
"eval_unseen_steps_per_second": 173.477,
"epoch": 5.825632784250703,
"step": 14500
},
{
"loss": 0.00021345250308513642,
"grad_norm": 0.0009313533664681017,
"learning_rate": 3.8172797415317974e-05,
"epoch": 5.8457211731619125,
"step": 14550
},
{
"loss": 0.0028869000077247618,
"grad_norm": 0.002781760646030307,
"learning_rate": 3.786016697453604e-05,
"epoch": 5.865809562073122,
"step": 14600
},
{
"loss": 0.0006874355673789978,
"grad_norm": 0.005940814968198538,
"learning_rate": 3.7548040066090386e-05,
"epoch": 5.885897950984331,
"step": 14650
},
{
"loss": 0.002895154058933258,
"grad_norm": 0.005510283168405294,
"learning_rate": 3.723642963628686e-05,
"epoch": 5.905986339895541,
"step": 14700
},
{
"loss": 0.001371142715215683,
"grad_norm": 0.024149959906935692,
"learning_rate": 3.692534861000897e-05,
"epoch": 5.92607472880675,
"step": 14750
},
{
"loss": 0.0004990202561020852,
"grad_norm": 2.1117215156555176,
"learning_rate": 3.661480989018177e-05,
"epoch": 5.946163117717959,
"step": 14800
},
{
"loss": 0.0032197386026382446,
"grad_norm": 0.0015058110002428293,
"learning_rate": 3.6304826357236765e-05,
"epoch": 5.966251506629169,
"step": 14850
},
{
"loss": 0.0005698489025235176,
"grad_norm": 0.004746470134705305,
"learning_rate": 3.599541086857748e-05,
"epoch": 5.986339895540378,
"step": 14900
},
{
"loss": 0.0002272239327430725,
"grad_norm": 0.0004718729469459504,
"learning_rate": 3.5686576258046344e-05,
"epoch": 6.006428284451587,
"step": 14950
},
{
"loss": 0.0030455261468887327,
"grad_norm": 0.03686371073126793,
"learning_rate": 3.5378335335392245e-05,
"epoch": 6.026516673362797,
"step": 15000
},
{
"eval_seen_loss": 0.01733102835714817,
"eval_seen_accuracy": 0.9977355072463768,
"eval_seen_f1_valid": 0.9982321744254568,
"eval_seen_f1_invalid": 0.9968507243334034,
"eval_seen_macro_f1": 0.9975414493794301,
"eval_seen_majority_baseline": 0.6400966183574879,
"eval_seen_runtime": 0.3365,
"eval_seen_samples_per_second": 19686.252,
"eval_seen_steps_per_second": 154.542,
"epoch": 6.026516673362797,
"step": 15000
},
{
"eval_unseen_loss": 0.06736034899950027,
"eval_unseen_accuracy": 0.986262077294686,
"eval_unseen_f1_valid": 0.989237137788291,
"eval_unseen_f1_invalid": 0.9810139787189651,
"eval_unseen_macro_f1": 0.985125558253628,
"eval_unseen_majority_baseline": 0.6400966183574879,
"eval_unseen_runtime": 0.3306,
"eval_unseen_samples_per_second": 20034.851,
"eval_unseen_steps_per_second": 157.278,
"epoch": 6.026516673362797,
"step": 15000
},
{
"loss": 0.00037648912519216537,
"grad_norm": 0.000664414488710463,
"learning_rate": 3.507070088573934e-05,
"epoch": 6.046605062274006,
"step": 15050
},
{
"loss": 0.0020931462943553926,
"grad_norm": 0.009824547916650772,
"learning_rate": 3.4763685669056607e-05,
"epoch": 6.066693451185215,
"step": 15100
},
{
"loss": 0.0007150228321552277,
"grad_norm": 0.0012331090401858091,
"learning_rate": 3.4457302419628706e-05,
"epoch": 6.086781840096425,
"step": 15150
},
{
"loss": 2.3746751248836518e-05,
"grad_norm": 0.0010286089964210987,
"learning_rate": 3.4151563845527714e-05,
"epoch": 6.106870229007634,
"step": 15200
},
{
"loss": 4.286464303731918e-05,
"grad_norm": 0.0036701043136417866,
"learning_rate": 3.3846482628086104e-05,
"epoch": 6.126958617918843,
"step": 15250
},
{
"loss": 0.0011537586152553557,
"grad_norm": 0.0007002303609624505,
"learning_rate": 3.35420714213707e-05,
"epoch": 6.147047006830052,
"step": 15300
},
{
"loss": 0.0002453260496258736,
"grad_norm": 0.0014305695658549666,
"learning_rate": 3.3238342851657786e-05,
"epoch": 6.167135395741261,
"step": 15350
},
{
"loss": 0.0010268088430166245,
"grad_norm": 0.02988343872129917,
"learning_rate": 3.293530951690944e-05,
"epoch": 6.1872237846524705,
"step": 15400
},
{
"loss": 0.0021796417236328125,
"grad_norm": 0.0006717279902659357,
"learning_rate": 3.263298398625106e-05,
"epoch": 6.20731217356368,
"step": 15450
},
{
"loss": 5.535826086997986e-05,
"grad_norm": 0.001610444625839591,
"learning_rate": 3.2331378799449875e-05,
"epoch": 6.227400562474889,
"step": 15500
},
{
"eval_seen_loss": 0.016191324219107628,
"eval_seen_accuracy": 0.9972826086956522,
"eval_seen_f1_valid": 0.9978788592976667,
"eval_seen_f1_invalid": 0.9962200755984879,
"eval_seen_macro_f1": 0.9970494674480773,
"eval_seen_majority_baseline": 0.6400966183574879,
"eval_seen_runtime": 0.3199,
"eval_seen_samples_per_second": 20706.021,
"eval_seen_steps_per_second": 162.547,
"epoch": 6.227400562474889,
"step": 15500
},
{
"eval_unseen_loss": 0.08634968847036362,
"eval_unseen_accuracy": 0.9841485507246377,
"eval_unseen_f1_valid": 0.987560715555029,
"eval_unseen_f1_invalid": 0.9781568545870605,
"eval_unseen_macro_f1": 0.9828587850710447,
"eval_unseen_majority_baseline": 0.6400966183574879,
"eval_unseen_runtime": 0.3057,
"eval_unseen_samples_per_second": 21665.898,
"eval_unseen_steps_per_second": 170.083,
"epoch": 6.227400562474889,
"step": 15500
},
{
"loss": 0.002557535767555237,
"grad_norm": 0.0008218715083785355,
"learning_rate": 3.203050646639496e-05,
"epoch": 6.2474889513860985,
"step": 15550
},
{
"loss": 0.0009405004978179931,
"grad_norm": 0.0009019052959047258,
"learning_rate": 3.1730379466578266e-05,
"epoch": 6.267577340297308,
"step": 15600
},
{
"loss": 0.0013148632645606994,
"grad_norm": 0.0005091215716674924,
"learning_rate": 3.143101024857708e-05,
"epoch": 6.287665729208517,
"step": 15650
},
{
"loss": 0.0036501625180244447,
"grad_norm": 0.002635682700201869,
"learning_rate": 3.113241122953761e-05,
"epoch": 6.3077541181197265,
"step": 15700
},
{
"loss": 0.0032262831926345827,
"grad_norm": 0.0013482654467225075,
"learning_rate": 3.0834594794659994e-05,
"epoch": 6.327842507030936,
"step": 15750
},
{
"loss": 0.00024218712002038956,
"grad_norm": 0.000721741293091327,
"learning_rate": 3.053757329668457e-05,
"epoch": 6.347930895942145,
"step": 15800
},
{
"loss": 3.9498805999755856e-05,
"grad_norm": 0.00035534962080419064,
"learning_rate": 3.024135905537956e-05,
"epoch": 6.3680192848533546,
"step": 15850
},
{
"loss": 1.3891272246837615e-05,
"grad_norm": 0.000355778553057462,
"learning_rate": 2.9945964357029987e-05,
"epoch": 6.388107673764564,
"step": 15900
},
{
"loss": 3.9079450070858e-05,
"grad_norm": 0.07650864869356155,
"learning_rate": 2.9651401453928163e-05,
"epoch": 6.408196062675773,
"step": 15950
},
{
"loss": 0.00021860454231500625,
"grad_norm": 0.0003715547500178218,
"learning_rate": 2.9357682563865373e-05,
"epoch": 6.428284451586983,
"step": 16000
},
{
"eval_seen_loss": 0.014586011879146099,
"eval_seen_accuracy": 0.9978864734299517,
"eval_seen_f1_valid": 0.9983494458854045,
"eval_seen_f1_invalid": 0.9970625262274444,
"eval_seen_macro_f1": 0.9977059860564245,
"eval_seen_majority_baseline": 0.6400966183574879,
"eval_seen_runtime": 0.3205,
"eval_seen_samples_per_second": 20666.622,
"eval_seen_steps_per_second": 162.238,
"epoch": 6.428284451586983,
"step": 16000
},
{
"eval_unseen_loss": 0.06505319476127625,
"eval_unseen_accuracy": 0.988677536231884,
"eval_unseen_f1_valid": 0.9911650371068441,
"eval_unseen_f1_invalid": 0.9842403866358479,
"eval_unseen_macro_f1": 0.987702711871346,
"eval_unseen_majority_baseline": 0.6400966183574879,
"eval_unseen_runtime": 0.2959,
"eval_unseen_samples_per_second": 22385.627,
"eval_unseen_steps_per_second": 175.733,
"epoch": 6.428284451586983,
"step": 16000
},
{
"loss": 1.775696873664856e-05,
"grad_norm": 0.0004017347819171846,
"learning_rate": 2.9064819869625314e-05,
"epoch": 6.448372840498192,
"step": 16050
},
{
"loss": 0.00019178256392478942,
"grad_norm": 0.0005201531457714736,
"learning_rate": 2.8772825518478525e-05,
"epoch": 6.468461229409401,
"step": 16100
},
{
"loss": 1.9734539091587066e-05,
"grad_norm": 0.0006806280580349267,
"learning_rate": 2.848171162167871e-05,
"epoch": 6.488549618320611,
"step": 16150
},
{
"loss": 0.0001803133264183998,
"grad_norm": 0.0003293660993222147,
"learning_rate": 2.8191490253960375e-05,
"epoch": 6.50863800723182,
"step": 16200
},
{
"loss": 1.029331237077713e-05,
"grad_norm": 0.0003172715369146317,
"learning_rate": 2.7902173453037982e-05,
"epoch": 6.528726396143029,
"step": 16250
},
{
"loss": 0.0013763304054737091,
"grad_norm": 3.6225039958953857,
"learning_rate": 2.761377321910661e-05,
"epoch": 6.548814785054239,
"step": 16300
},
{
"loss": 0.0025291353464126586,
"grad_norm": 0.0003018236602656543,
"learning_rate": 2.7326301514344256e-05,
"epoch": 6.568903173965448,
"step": 16350
},
{
"loss": 0.002325804829597473,
"grad_norm": 0.00033842388074845076,
"learning_rate": 2.7039770262415655e-05,
"epoch": 6.588991562876657,
"step": 16400
},
{
"loss": 0.0033012521266937256,
"grad_norm": 0.0036098379641771317,
"learning_rate": 2.6754191347977748e-05,
"epoch": 6.609079951787867,
"step": 16450
},
{
"loss": 0.0001065874844789505,
"grad_norm": 0.00032605676096864045,
"learning_rate": 2.646957661618672e-05,
"epoch": 6.629168340699076,
"step": 16500
},
{
"eval_seen_loss": 0.013449776917696,
"eval_seen_accuracy": 0.9978864734299517,
"eval_seen_f1_valid": 0.9983502238981853,
"eval_seen_f1_invalid": 0.997060058798824,
"eval_seen_macro_f1": 0.9977051413485046,
"eval_seen_majority_baseline": 0.6400966183574879,
"eval_seen_runtime": 0.3205,
"eval_seen_samples_per_second": 20670.42,
"eval_seen_steps_per_second": 162.268,
"epoch": 6.629168340699076,
"step": 16500
},
{
"eval_unseen_loss": 0.06277448683977127,
"eval_unseen_accuracy": 0.9898852657004831,
"eval_unseen_f1_valid": 0.9921130076515596,
"eval_unseen_f1_invalid": 0.985903639806438,
"eval_unseen_macro_f1": 0.9890083237289988,
"eval_unseen_majority_baseline": 0.6400966183574879,
"eval_unseen_runtime": 0.3053,
"eval_unseen_samples_per_second": 21694.422,
"eval_unseen_steps_per_second": 170.306,
"epoch": 6.629168340699076,
"step": 16500
},
{
"loss": 2.7056075632572176e-05,
"grad_norm": 0.0002598020655568689,
"learning_rate": 2.6185937872206645e-05,
"epoch": 6.649256729610285,
"step": 16550
},
{
"loss": 1.0665915906429291e-05,
"grad_norm": 0.00029112983611412346,
"learning_rate": 2.5903286880719852e-05,
"epoch": 6.669345118521495,
"step": 16600
},
{
"loss": 2.9137618839740752e-05,
"grad_norm": 0.00034989695996046066,
"learning_rate": 2.5621635365439034e-05,
"epoch": 6.689433507432704,
"step": 16650
},
{
"loss": 0.0004712997749447823,
"grad_norm": 0.00025116666802205145,
"learning_rate": 2.534099500862085e-05,
"epoch": 6.709521896343913,
"step": 16700
},
{
"loss": 1.5728212893009187e-05,
"grad_norm": 0.0003110774850938469,
"learning_rate": 2.506137745058148e-05,
"epoch": 6.729610285255123,
"step": 16750
},
{
"loss": 0.0017288799583911895,
"grad_norm": 0.002883067587390542,
"learning_rate": 2.478279428921371e-05,
"epoch": 6.749698674166332,
"step": 16800
},
{
"loss": 0.002549371421337128,
"grad_norm": 0.00043419309076853096,
"learning_rate": 2.4505257079506012e-05,
"epoch": 6.769787063077541,
"step": 16850
},
{
"loss": 8.197244256734849e-05,
"grad_norm": 0.0023284712806344032,
"learning_rate": 2.422877733306309e-05,
"epoch": 6.789875451988751,
"step": 16900
},
{
"loss": 3.0123256146907805e-05,
"grad_norm": 0.006009037606418133,
"learning_rate": 2.3953366517628607e-05,
"epoch": 6.80996384089996,
"step": 16950
},
{
"loss": 0.001429406851530075,
"grad_norm": 0.010161327198147774,
"learning_rate": 2.367903605660934e-05,
"epoch": 6.830052229811169,
"step": 17000
},
{
"eval_seen_loss": 0.01531138364225626,
"eval_seen_accuracy": 0.9978864734299517,
"eval_seen_f1_valid": 0.9983502238981853,
"eval_seen_f1_invalid": 0.997060058798824,
"eval_seen_macro_f1": 0.9977051413485046,
"eval_seen_majority_baseline": 0.6400966183574879,
"eval_seen_runtime": 0.3346,
"eval_seen_samples_per_second": 19798.834,
"eval_seen_steps_per_second": 155.426,
"epoch": 6.830052229811169,
"step": 17000
},
{
"eval_unseen_loss": 0.09234398603439331,
"eval_unseen_accuracy": 0.9865640096618358,
"eval_unseen_f1_valid": 0.989488602810913,
"eval_unseen_f1_invalid": 0.9813846475632713,
"eval_unseen_macro_f1": 0.9854366251870921,
"eval_unseen_majority_baseline": 0.6400966183574879,
"eval_unseen_runtime": 0.3053,
"eval_unseen_samples_per_second": 21698.031,
"eval_unseen_steps_per_second": 170.335,
"epoch": 6.830052229811169,
"step": 17000
},
{
"loss": 0.004940186142921448,
"grad_norm": 0.0007521524094045162,
"learning_rate": 2.340579732860152e-05,
"epoch": 6.850140618722379,
"step": 17050
},
{
"loss": 2.277746796607971e-05,
"grad_norm": 0.0003301052493043244,
"learning_rate": 2.3133661666918765e-05,
"epoch": 6.870229007633588,
"step": 17100
},
{
"loss": 3.1196326017379763e-05,
"grad_norm": 0.00048009969759732485,
"learning_rate": 2.2862640359122027e-05,
"epoch": 6.8903173965447975,
"step": 17150
},
{
"loss": 1.5532001852989197e-05,
"grad_norm": 0.0003433611709624529,
"learning_rate": 2.259274464655147e-05,
"epoch": 6.910405785456007,
"step": 17200
},
{
"loss": 0.0006354102492332459,
"grad_norm": 0.0005477304221130908,
"learning_rate": 2.2323985723860148e-05,
"epoch": 6.930494174367215,
"step": 17250
},
{
"loss": 0.00010105263441801071,
"grad_norm": 0.001819954952225089,
"learning_rate": 2.2056374738549657e-05,
"epoch": 6.9505825632784255,
"step": 17300
},
{
"loss": 0.0024885176122188568,
"grad_norm": 0.00035599080729298294,
"learning_rate": 2.1789922790507816e-05,
"epoch": 6.970670952189634,
"step": 17350
},
{
"loss": 0.000506746768951416,
"grad_norm": 0.002056804718449712,
"learning_rate": 2.152464093154821e-05,
"epoch": 6.990759341100844,
"step": 17400
},
{
"loss": 3.9716772735118864e-05,
"grad_norm": 0.0003199533966835588,
"learning_rate": 2.126054016495188e-05,
"epoch": 7.010847730012053,
"step": 17450
},
{
"loss": 2.2945143282413483e-05,
"grad_norm": 0.0002348485286347568,
"learning_rate": 2.0997631445010858e-05,
"epoch": 7.030936118923262,
"step": 17500
},
{
"eval_seen_loss": 0.01327558420598507,
"eval_seen_accuracy": 0.9977355072463768,
"eval_seen_f1_valid": 0.9982325910215624,
"eval_seen_f1_invalid": 0.9968494013862634,
"eval_seen_macro_f1": 0.9975409962039129,
"eval_seen_majority_baseline": 0.6400966183574879,
"eval_seen_runtime": 0.3251,
"eval_seen_samples_per_second": 20376.02,
"eval_seen_steps_per_second": 159.957,
"epoch": 7.030936118923262,
"step": 17500
},
{
"eval_unseen_loss": 0.08052626252174377,
"eval_unseen_accuracy": 0.9871678743961353,
"eval_unseen_f1_valid": 0.9899752329284113,
"eval_unseen_f1_invalid": 0.982176556930174,
"eval_unseen_macro_f1": 0.9860758949292927,
"eval_unseen_majority_baseline": 0.6400966183574879,
"eval_unseen_runtime": 0.3089,
"eval_unseen_samples_per_second": 21446.92,
"eval_unseen_steps_per_second": 168.364,
"epoch": 7.030936118923262,
"step": 17500
},
{
"loss": 1.6945749521255494e-05,
"grad_norm": 0.00024341772950720042,
"learning_rate": 2.0735925676573785e-05,
"epoch": 7.051024507834471,
"step": 17550
},
{
"loss": 0.0011683499813079834,
"grad_norm": 0.000335768359946087,
"learning_rate": 2.047543371459366e-05,
"epoch": 7.071112896745681,
"step": 17600
},
{
"loss": 0.004646786451339722,
"grad_norm": 0.00035198635305278003,
"learning_rate": 2.021616636367762e-05,
"epoch": 7.09120128565689,
"step": 17650
},
{
"loss": 0.00020644064992666244,
"grad_norm": 0.0004466926911845803,
"learning_rate": 1.9958134377638687e-05,
"epoch": 7.111289674568099,
"step": 17700
},
{
"loss": 6.792254745960235e-05,
"grad_norm": 0.0007776455604471266,
"learning_rate": 1.9701348459049874e-05,
"epoch": 7.131378063479309,
"step": 17750
},
{
"loss": 0.0004381958022713661,
"grad_norm": 0.0003025882178917527,
"learning_rate": 1.944581925880009e-05,
"epoch": 7.151466452390518,
"step": 17800
},
{
"loss": 6.515607237815857e-06,
"grad_norm": 0.00025550602003932,
"learning_rate": 1.9191557375652546e-05,
"epoch": 7.171554841301727,
"step": 17850
},
{
"loss": 8.427612483501434e-06,
"grad_norm": 0.00029596281819976866,
"learning_rate": 1.893857335580499e-05,
"epoch": 7.191643230212937,
"step": 17900
},
{
"loss": 9.106919169425964e-06,
"grad_norm": 0.0002097087271977216,
"learning_rate": 1.868687769245239e-05,
"epoch": 7.211731619124146,
"step": 17950
},
{
"loss": 1.7725974321365355e-05,
"grad_norm": 0.0005719594773836434,
"learning_rate": 1.8436480825351605e-05,
"epoch": 7.231820008035355,
"step": 18000
},
{
"eval_seen_loss": 0.014237217605113983,
"eval_seen_accuracy": 0.9977355072463768,
"eval_seen_f1_valid": 0.998231340643792,
"eval_seen_f1_invalid": 0.9968533668974197,
"eval_seen_macro_f1": 0.9975423537706058,
"eval_seen_majority_baseline": 0.6400966183574879,
"eval_seen_runtime": 0.3163,
"eval_seen_samples_per_second": 20941.881,
"eval_seen_steps_per_second": 164.399,
"epoch": 7.231820008035355,
"step": 18000
},
{
"eval_unseen_loss": 0.05696876347064972,
"eval_unseen_accuracy": 0.9909420289855072,
"eval_unseen_f1_valid": 0.9929245283018868,
"eval_unseen_f1_invalid": 0.9874161073825504,
"eval_unseen_macro_f1": 0.9901703178422185,
"eval_unseen_majority_baseline": 0.6400966183574879,
"eval_unseen_runtime": 0.3145,
"eval_unseen_samples_per_second": 21061.294,
"eval_unseen_steps_per_second": 165.336,
"epoch": 7.231820008035355,
"step": 18000
},
{
"loss": 6.993412971496582e-06,
"grad_norm": 0.0002458687813486904,
"learning_rate": 1.818739314038847e-05,
"epoch": 7.251908396946565,
"step": 18050
},
{
"loss": 0.0008838069438934326,
"grad_norm": 0.0003040506271645427,
"learning_rate": 1.793962496914691e-05,
"epoch": 7.271996785857774,
"step": 18100
},
{
"loss": 0.00013988766819238662,
"grad_norm": 0.0010905415983870625,
"learning_rate": 1.769318658848046e-05,
"epoch": 7.292085174768983,
"step": 18150
},
{
"loss": 4.3235272169113156e-05,
"grad_norm": 0.0003398769476916641,
"learning_rate": 1.7448088220086028e-05,
"epoch": 7.312173563680193,
"step": 18200
},
{
"loss": 5.77002763748169e-06,
"grad_norm": 0.000229157623834908,
"learning_rate": 1.7204340030079912e-05,
"epoch": 7.332261952591402,
"step": 18250
},
{
"loss": 6.55684620141983e-06,
"grad_norm": 0.00021728631691075861,
"learning_rate": 1.6961952128576064e-05,
"epoch": 7.3523503415026115,
"step": 18300
},
{
"loss": 1.53171643614769e-05,
"grad_norm": 0.00021770535386167467,
"learning_rate": 1.6720934569266826e-05,
"epoch": 7.372438730413821,
"step": 18350
},
{
"loss": 0.00031239636242389677,
"grad_norm": 0.0006413852097466588,
"learning_rate": 1.64812973490059e-05,
"epoch": 7.39252711932503,
"step": 18400
},
{
"loss": 9.444206953048706e-06,
"grad_norm": 0.00024652466527186334,
"learning_rate": 1.6243050407393696e-05,
"epoch": 7.4126155082362395,
"step": 18450
},
{
"loss": 3.102324903011322e-05,
"grad_norm": 0.001528206979855895,
"learning_rate": 1.6006203626365097e-05,
"epoch": 7.432703897147449,
"step": 18500
},
{
"eval_seen_loss": 0.011784316040575504,
"eval_seen_accuracy": 0.9980374396135265,
"eval_seen_f1_valid": 0.9984678845020625,
"eval_seen_f1_invalid": 0.9972706277556163,
"eval_seen_macro_f1": 0.9978692561288394,
"eval_seen_majority_baseline": 0.6400966183574879,
"eval_seen_runtime": 0.3094,
"eval_seen_samples_per_second": 21407.771,
"eval_seen_steps_per_second": 168.056,
"epoch": 7.432703897147449,
"step": 18500
},
{
"eval_unseen_loss": 0.04249073192477226,
"eval_unseen_accuracy": 0.9936594202898551,
"eval_unseen_f1_valid": 0.9950541686292981,
"eval_unseen_f1_invalid": 0.9911690496215307,
"eval_unseen_macro_f1": 0.9931116091254144,
"eval_unseen_majority_baseline": 0.6400966183574879,
"eval_unseen_runtime": 0.3055,
"eval_unseen_samples_per_second": 21685.396,
"eval_unseen_steps_per_second": 170.236,
"epoch": 7.432703897147449,
"step": 18500
},
{
"loss": 5.453340709209442e-06,
"grad_norm": 0.00019290638738311827,
"learning_rate": 1.5770766829779498e-05,
"epoch": 7.452792286058658,
"step": 18550
},
{
"loss": 1.5767738223075866e-05,
"grad_norm": 0.0003964620118495077,
"learning_rate": 1.5536749783013398e-05,
"epoch": 7.4728806749698675,
"step": 18600
},
{
"loss": 2.11561843752861e-05,
"grad_norm": 0.0002844040864147246,
"learning_rate": 1.530416219255536e-05,
"epoch": 7.492969063881077,
"step": 18650
},
{
"loss": 7.1339309215545654e-06,
"grad_norm": 0.0002172449603676796,
"learning_rate": 1.50730137056034e-05,
"epoch": 7.513057452792286,
"step": 18700
},
{
"loss": 6.715469062328339e-06,
"grad_norm": 0.00025726479361765087,
"learning_rate": 1.4843313909664786e-05,
"epoch": 7.5331458417034955,
"step": 18750
},
{
"loss": 1.2444481253623962e-05,
"grad_norm": 0.0002705488004721701,
"learning_rate": 1.4615072332158424e-05,
"epoch": 7.553234230614705,
"step": 18800
},
{
"loss": 5.9470906853675845e-06,
"grad_norm": 0.01123479101806879,
"learning_rate": 1.4388298440019732e-05,
"epoch": 7.573322619525914,
"step": 18850
},
{
"loss": 0.0002536303177475929,
"grad_norm": 0.00019734656962100416,
"learning_rate": 1.4163001639307843e-05,
"epoch": 7.593411008437124,
"step": 18900
},
{
"loss": 2.517692744731903e-05,
"grad_norm": 0.0017155244713649154,
"learning_rate": 1.39391912748156e-05,
"epoch": 7.613499397348333,
"step": 18950
},
{
"loss": 5.56260347366333e-06,
"grad_norm": 0.0002527149044908583,
"learning_rate": 1.371687662968183e-05,
"epoch": 7.633587786259542,
"step": 19000
},
{
"eval_seen_loss": 0.011350261978805065,
"eval_seen_accuracy": 0.9978864734299517,
"eval_seen_f1_valid": 0.9983494458854045,
"eval_seen_f1_invalid": 0.9970625262274444,
"eval_seen_macro_f1": 0.9977059860564245,
"eval_seen_majority_baseline": 0.6400966183574879,
"eval_seen_runtime": 0.3144,
"eval_seen_samples_per_second": 21067.587,
"eval_seen_steps_per_second": 165.386,
"epoch": 7.633587786259542,
"step": 19000
},
{
"eval_unseen_loss": 0.045558616518974304,
"eval_unseen_accuracy": 0.9941123188405797,
"eval_unseen_f1_valid": 0.9954112248499823,
"eval_unseen_f1_invalid": 0.9917877447883765,
"eval_unseen_macro_f1": 0.9935994848191794,
"eval_unseen_majority_baseline": 0.6400966183574879,
"eval_unseen_runtime": 0.305,
"eval_unseen_samples_per_second": 21718.385,
"eval_unseen_steps_per_second": 170.495,
"epoch": 7.633587786259542,
"step": 19000
},
{
"loss": 1.60391628742218e-05,
"grad_norm": 0.00019333165255375206,
"learning_rate": 1.3496066925006435e-05,
"epoch": 7.653676175170752,
"step": 19050
},
{
"loss": 1.3582371175289153e-05,
"grad_norm": 0.000267647992586717,
"learning_rate": 1.3276771319467785e-05,
"epoch": 7.673764564081961,
"step": 19100
},
{
"loss": 7.217995822429657e-05,
"grad_norm": 0.0003133589925710112,
"learning_rate": 1.3058998908942922e-05,
"epoch": 7.69385295299317,
"step": 19150
},
{
"loss": 1.6851797699928283e-05,
"grad_norm": 0.010939225554466248,
"learning_rate": 1.2842758726130283e-05,
"epoch": 7.71394134190438,
"step": 19200
},
{
"loss": 4.377402365207672e-06,
"grad_norm": 0.0005316520691849291,
"learning_rate": 1.2628059740175024e-05,
"epoch": 7.734029730815589,
"step": 19250
},
{
"loss": 0.00048248179256916047,
"grad_norm": 0.0003787012828979641,
"learning_rate": 1.2414910856296985e-05,
"epoch": 7.754118119726797,
"step": 19300
},
{
"loss": 4.041831940412521e-05,
"grad_norm": 0.00018383558199275285,
"learning_rate": 1.2203320915421346e-05,
"epoch": 7.774206508638008,
"step": 19350
},
{
"loss": 4.867933690547943e-05,
"grad_norm": 0.0001739686558721587,
"learning_rate": 1.1993298693811877e-05,
"epoch": 7.794294897549216,
"step": 19400
},
{
"loss": 1.4136731624603272e-05,
"grad_norm": 0.00019290608179289848,
"learning_rate": 1.1784852902707073e-05,
"epoch": 7.814383286460426,
"step": 19450
},
{
"loss": 4.587210714817047e-06,
"grad_norm": 0.0001746905327308923,
"learning_rate": 1.1577992187958615e-05,
"epoch": 7.834471675371635,
"step": 19500
},
{
"eval_seen_loss": 0.012746668420732021,
"eval_seen_accuracy": 0.9981884057971014,
"eval_seen_f1_valid": 0.9985859061984445,
"eval_seen_f1_invalid": 0.997480050398992,
"eval_seen_macro_f1": 0.9980329782987183,
"eval_seen_majority_baseline": 0.6400966183574879,
"eval_seen_runtime": 0.3302,
"eval_seen_samples_per_second": 20059.703,
"eval_seen_steps_per_second": 157.474,
"epoch": 7.834471675371635,
"step": 19500
},
{
"eval_unseen_loss": 0.04527498781681061,
"eval_unseen_accuracy": 0.9933574879227053,
"eval_unseen_f1_valid": 0.9948259642521167,
"eval_unseen_f1_invalid": 0.990725126475548,
"eval_unseen_macro_f1": 0.9927755453638323,
"eval_unseen_majority_baseline": 0.6400966183574879,
"eval_unseen_runtime": 0.3108,
"eval_unseen_samples_per_second": 21311.347,
"eval_unseen_steps_per_second": 167.299,
"epoch": 7.834471675371635,
"step": 19500
},
{
"loss": 0.00014036081731319427,
"grad_norm": 0.00023242826864589006,
"learning_rate": 1.1372725129672896e-05,
"epoch": 7.854560064282844,
"step": 19550
},
{
"loss": 5.762390792369842e-06,
"grad_norm": 0.00019600246741902083,
"learning_rate": 1.1169060241855095e-05,
"epoch": 7.8746484531940535,
"step": 19600
},
{
"loss": 4.053488373756408e-06,
"grad_norm": 0.00014491379261016846,
"learning_rate": 1.0967005972056083e-05,
"epoch": 7.894736842105263,
"step": 19650
},
{
"loss": 4.891790449619294e-06,
"grad_norm": 0.0002486503799445927,
"learning_rate": 1.0766570701021983e-05,
"epoch": 7.914825231016472,
"step": 19700
},
{
"loss": 3.816671669483185e-06,
"grad_norm": 0.00015516391431447119,
"learning_rate": 1.056776274234656e-05,
"epoch": 7.9349136199276815,
"step": 19750
},
{
"loss": 3.6293640732765198e-06,
"grad_norm": 0.00014282570919021964,
"learning_rate": 1.0370590342126412e-05,
"epoch": 7.955002008838891,
"step": 19800
},
{
"loss": 4.312135279178619e-06,
"grad_norm": 0.00013145770935807377,
"learning_rate": 1.0175061678618969e-05,
"epoch": 7.9750903977501,
"step": 19850
},
{
"loss": 1.159965991973877e-05,
"grad_norm": 0.00013499190390575677,
"learning_rate": 9.981184861903186e-06,
"epoch": 7.9951787866613095,
"step": 19900
},
{
"loss": 3.3606216311454773e-06,
"grad_norm": 0.00018055748660117388,
"learning_rate": 9.78896793354328e-06,
"epoch": 8.01526717557252,
"step": 19950
},
{
"loss": 5.6288763880729676e-06,
"grad_norm": 0.00015812755736988038,
"learning_rate": 9.59841886625506e-06,
"epoch": 8.035355564483728,
"step": 20000
},
{
"eval_seen_loss": 0.011836923658847809,
"eval_seen_accuracy": 0.9978864734299517,
"eval_seen_f1_valid": 0.9983498349834984,
"eval_seen_f1_invalid": 0.9970612930310664,
"eval_seen_macro_f1": 0.9977055640072824,
"eval_seen_majority_baseline": 0.6400966183574879,
"eval_seen_runtime": 0.3249,
"eval_seen_samples_per_second": 20390.795,
"eval_seen_steps_per_second": 160.073,
"epoch": 8.035355564483728,
"step": 20000
},
{
"eval_unseen_loss": 0.04228868708014488,
"eval_unseen_accuracy": 0.9947161835748792,
"eval_unseen_f1_valid": 0.9958808991408732,
"eval_unseen_f1_invalid": 0.9926331298673964,
"eval_unseen_macro_f1": 0.9942570145041347,
"eval_unseen_majority_baseline": 0.6400966183574879,
"eval_unseen_runtime": 0.3069,
"eval_unseen_samples_per_second": 21586.008,
"eval_unseen_steps_per_second": 169.455,
"epoch": 8.035355564483728,
"step": 20000
},
{
"loss": 3.6133453249931337e-06,
"grad_norm": 0.0002495869412086904,
"learning_rate": 9.40954556357535e-06,
"epoch": 8.055443953394938,
"step": 20050
},
{
"loss": 3.3559650182724e-06,
"grad_norm": 0.00026279842131771147,
"learning_rate": 9.222355859534071e-06,
"epoch": 8.075532342306147,
"step": 20100
},
{
"loss": 3.551878035068512e-06,
"grad_norm": 0.0001303624449064955,
"learning_rate": 9.036857518329356e-06,
"epoch": 8.095620731217357,
"step": 20150
},
{
"loss": 3.4165382385253906e-06,
"grad_norm": 0.00014572461077477783,
"learning_rate": 8.853058234005512e-06,
"epoch": 8.115709120128566,
"step": 20200
},
{
"loss": 0.0004174730554223061,
"grad_norm": 0.6496160626411438,
"learning_rate": 8.670965630133893e-06,
"epoch": 8.135797509039776,
"step": 20250
},
{
"loss": 6.2954053282737735e-06,
"grad_norm": 0.0005189924850128591,
"learning_rate": 8.490587259496635e-06,
"epoch": 8.155885897950984,
"step": 20300
},
{
"loss": 0.00034780647605657576,
"grad_norm": 0.00014101318083703518,
"learning_rate": 8.311930603773438e-06,
"epoch": 8.175974286862195,
"step": 20350
},
{
"loss": 9.302161633968354e-06,
"grad_norm": 0.00019721974967978895,
"learning_rate": 8.135003073231246e-06,
"epoch": 8.196062675773403,
"step": 20400
},
{
"loss": 1.5042945742607116e-05,
"grad_norm": 0.00016112760931719095,
"learning_rate": 7.959812006416861e-06,
"epoch": 8.216151064684611,
"step": 20450
},
{
"loss": 3.8015469908714295e-06,
"grad_norm": 0.0003184220695402473,
"learning_rate": 7.78636466985257e-06,
"epoch": 8.236239453595822,
"step": 20500
},
{
"eval_seen_loss": 0.012019069865345955,
"eval_seen_accuracy": 0.9978864734299517,
"eval_seen_f1_valid": 0.9983498349834984,
"eval_seen_f1_invalid": 0.9970612930310664,
"eval_seen_macro_f1": 0.9977055640072824,
"eval_seen_majority_baseline": 0.6400966183574879,
"eval_seen_runtime": 0.3216,
"eval_seen_samples_per_second": 20600.148,
"eval_seen_steps_per_second": 161.716,
"epoch": 8.236239453595822,
"step": 20500
},
{
"eval_unseen_loss": 0.03911798819899559,
"eval_unseen_accuracy": 0.9945652173913043,
"eval_unseen_f1_valid": 0.9957627118644068,
"eval_unseen_f1_invalid": 0.9924242424242424,
"eval_unseen_macro_f1": 0.9940934771443246,
"eval_unseen_majority_baseline": 0.6400966183574879,
"eval_unseen_runtime": 0.3311,
"eval_unseen_samples_per_second": 20004.327,
"eval_unseen_steps_per_second": 157.039,
"epoch": 8.236239453595822,
"step": 20500
},
{
"loss": 4.818551242351532e-06,
"grad_norm": 0.00016147899441421032,
"learning_rate": 7.614668257734719e-06,
"epoch": 8.25632784250703,
"step": 20550
},
{
"loss": 7.018953561782837e-05,
"grad_norm": 0.00044564157724380493,
"learning_rate": 7.444729891635349e-06,
"epoch": 8.27641623141824,
"step": 20600
},
{
"loss": 3.513358533382416e-06,
"grad_norm": 0.00014842434029560536,
"learning_rate": 7.2765566202068206e-06,
"epoch": 8.296504620329449,
"step": 20650
},
{
"loss": 3.3337250351905822e-06,
"grad_norm": 0.00013708991173189133,
"learning_rate": 7.110155418889419e-06,
"epoch": 8.316593009240659,
"step": 20700
},
{
"loss": 1.0120011866092682e-05,
"grad_norm": 0.0001332744723185897,
"learning_rate": 6.945533189622022e-06,
"epoch": 8.336681398151867,
"step": 20750
},
{
"loss": 3.4270063042640684e-06,
"grad_norm": 0.00013819074956700206,
"learning_rate": 6.7826967605558344e-06,
"epoch": 8.356769787063078,
"step": 20800
},
{
"loss": 1.0085813701152801e-05,
"grad_norm": 0.00014096000813879073,
"learning_rate": 6.621652885771229e-06,
"epoch": 8.376858175974286,
"step": 20850
},
{
"loss": 3.064647316932678e-06,
"grad_norm": 0.00014031221508048475,
"learning_rate": 6.462408244997486e-06,
"epoch": 8.396946564885496,
"step": 20900
},
{
"loss": 3.0971691012382507e-06,
"grad_norm": 0.00013209764438215643,
"learning_rate": 6.304969443335862e-06,
"epoch": 8.417034953796705,
"step": 20950
},
{
"loss": 3.0650943517684936e-06,
"grad_norm": 0.00014701248437631875,
"learning_rate": 6.149343010985503e-06,
"epoch": 8.437123342707915,
"step": 21000
},
{
"eval_seen_loss": 0.012507510371506214,
"eval_seen_accuracy": 0.9981884057971014,
"eval_seen_f1_valid": 0.9985859061984445,
"eval_seen_f1_invalid": 0.997480050398992,
"eval_seen_macro_f1": 0.9980329782987183,
"eval_seen_majority_baseline": 0.6400966183574879,
"eval_seen_runtime": 0.3268,
"eval_seen_samples_per_second": 20271.593,
"eval_seen_steps_per_second": 159.137,
"epoch": 8.437123342707915,
"step": 21000
},
{
"eval_unseen_loss": 0.03895845264196396,
"eval_unseen_accuracy": 0.9942632850241546,
"eval_unseen_f1_valid": 0.9955283596140269,
"eval_unseen_f1_invalid": 0.992,
"eval_unseen_macro_f1": 0.9937641798070134,
"eval_unseen_majority_baseline": 0.6400966183574879,
"eval_unseen_runtime": 0.3107,
"eval_unseen_samples_per_second": 21317.822,
"eval_unseen_steps_per_second": 167.35,
"epoch": 8.437123342707915,
"step": 21000
},
{
"loss": 3.073066473007202e-06,
"grad_norm": 0.00013140306691639125,
"learning_rate": 5.995535402972702e-06,
"epoch": 8.457211731619124,
"step": 21050
},
{
"loss": 4.372160881757736e-05,
"grad_norm": 0.00014569831546396017,
"learning_rate": 5.843552998883073e-06,
"epoch": 8.477300120530334,
"step": 21100
},
{
"loss": 3.0318647623062134e-06,
"grad_norm": 0.00016386796778533608,
"learning_rate": 5.693402102596962e-06,
"epoch": 8.497388509441542,
"step": 21150
},
{
"loss": 4.044137895107269e-06,
"grad_norm": 0.0001544577971799299,
"learning_rate": 5.545088942028009e-06,
"epoch": 8.517476898352752,
"step": 21200
},
{
"loss": 3.307312726974487e-06,
"grad_norm": 0.0002282865607412532,
"learning_rate": 5.398619668864818e-06,
"epoch": 8.537565287263961,
"step": 21250
},
{
"loss": 3.1630322337150576e-06,
"grad_norm": 0.00012746526044793427,
"learning_rate": 5.2540003583157525e-06,
"epoch": 8.557653676175171,
"step": 21300
},
{
"loss": 2.9011070728302e-06,
"grad_norm": 0.00010656457743607461,
"learning_rate": 5.111237008856984e-06,
"epoch": 8.57774206508638,
"step": 21350
},
{
"loss": 3.054514527320862e-06,
"grad_norm": 0.00010875113366637379,
"learning_rate": 4.970335541983723e-06,
"epoch": 8.59783045399759,
"step": 21400
},
{
"loss": 3.0556321144104004e-06,
"grad_norm": 0.0001811092661228031,
"learning_rate": 4.831301801964555e-06,
"epoch": 8.617918842908798,
"step": 21450
},
{
"loss": 3.187432885169983e-06,
"grad_norm": 0.00012966326903551817,
"learning_rate": 4.694141555599058e-06,
"epoch": 8.638007231820009,
"step": 21500
},
{
"eval_seen_loss": 0.012946849688887596,
"eval_seen_accuracy": 0.9981884057971014,
"eval_seen_f1_valid": 0.9985859061984445,
"eval_seen_f1_invalid": 0.997480050398992,
"eval_seen_macro_f1": 0.9980329782987183,
"eval_seen_majority_baseline": 0.6400966183574879,
"eval_seen_runtime": 0.3132,
"eval_seen_samples_per_second": 21146.93,
"eval_seen_steps_per_second": 166.009,
"epoch": 8.638007231820009,
"step": 21500
},
{
"eval_unseen_loss": 0.04752921685576439,
"eval_unseen_accuracy": 0.9930555555555556,
"eval_unseen_f1_valid": 0.9945920526687044,
"eval_unseen_f1_invalid": 0.9902994517081402,
"eval_unseen_macro_f1": 0.9924457521884222,
"eval_unseen_majority_baseline": 0.6400966183574879,
"eval_unseen_runtime": 0.3071,
"eval_unseen_samples_per_second": 21566.403,
"eval_unseen_steps_per_second": 169.301,
"epoch": 8.638007231820009,
"step": 21500
},
{
"loss": 3.5515427589416504e-06,
"grad_norm": 0.00013049629342276603,
"learning_rate": 4.5588604919785895e-06,
"epoch": 8.658095620731217,
"step": 21550
},
{
"loss": 2.780258655548096e-06,
"grad_norm": 0.0001262566656805575,
"learning_rate": 4.425464222250348e-06,
"epoch": 8.678184009642427,
"step": 21600
},
{
"loss": 4.116110503673554e-06,
"grad_norm": 0.000128673724248074,
"learning_rate": 4.293958279384608e-06,
"epoch": 8.698272398553636,
"step": 21650
},
{
"loss": 8.174490183591842e-05,
"grad_norm": 0.0005245626671239734,
"learning_rate": 4.16434811794526e-06,
"epoch": 8.718360787464846,
"step": 21700
},
{
"loss": 7.002241909503937e-06,
"grad_norm": 0.00013448468234855682,
"learning_rate": 4.036639113863522e-06,
"epoch": 8.738449176376054,
"step": 21750
},
{
"loss": 2.822093665599823e-06,
"grad_norm": 0.00012475447147153318,
"learning_rate": 3.910836564214965e-06,
"epoch": 8.758537565287265,
"step": 21800
},
{
"loss": 2.5692582130432127e-06,
"grad_norm": 0.00011487610754556954,
"learning_rate": 3.7869456869998597e-06,
"epoch": 8.778625954198473,
"step": 21850
},
{
"loss": 2.6272982358932495e-06,
"grad_norm": 0.00014223760808818042,
"learning_rate": 3.664971620926666e-06,
"epoch": 8.798714343109683,
"step": 21900
},
{
"loss": 2.6938319206237793e-06,
"grad_norm": 0.00010725839820224792,
"learning_rate": 3.5449194251989505e-06,
"epoch": 8.818802732020892,
"step": 21950
},
{
"loss": 1.2151449918746949e-05,
"grad_norm": 0.0001417612365912646,
"learning_rate": 3.4267940793055063e-06,
"epoch": 8.838891120932102,
"step": 22000
},
{
"eval_seen_loss": 0.012583291158080101,
"eval_seen_accuracy": 0.9980374396135265,
"eval_seen_f1_valid": 0.9984678845020625,
"eval_seen_f1_invalid": 0.9972706277556163,
"eval_seen_macro_f1": 0.9978692561288394,
"eval_seen_majority_baseline": 0.6400966183574879,
"eval_seen_runtime": 0.3161,
"eval_seen_samples_per_second": 20954.738,
"eval_seen_steps_per_second": 164.5,
"epoch": 8.838891120932102,
"step": 22000
},
{
"eval_unseen_loss": 0.04813293740153313,
"eval_unseen_accuracy": 0.9936594202898551,
"eval_unseen_f1_valid": 0.9950599858856739,
"eval_unseen_f1_invalid": 0.9911504424778761,
"eval_unseen_macro_f1": 0.993105214181775,
"eval_unseen_majority_baseline": 0.6400966183574879,
"eval_unseen_runtime": 0.3177,
"eval_unseen_samples_per_second": 20849.332,
"eval_unseen_steps_per_second": 163.672,
"epoch": 8.838891120932102,
"step": 22000
},
{
"loss": 6.3090398907661436e-06,
"grad_norm": 0.00020181726722512394,
"learning_rate": 3.3106004828138525e-06,
"epoch": 8.85897950984331,
"step": 22050
},
{
"loss": 2.9055774211883546e-06,
"grad_norm": 0.00015510858793277293,
"learning_rate": 3.19634345516695e-06,
"epoch": 8.87906789875452,
"step": 22100
},
{
"loss": 2.4076923727989195e-06,
"grad_norm": 0.00020350102568045259,
"learning_rate": 3.0840277354833856e-06,
"epoch": 8.899156287665729,
"step": 22150
},
{
"loss": 2.4836510419845583e-06,
"grad_norm": 0.00012597607565112412,
"learning_rate": 2.9736579823607224e-06,
"epoch": 8.91924467657694,
"step": 22200
},
{
"loss": 2.3871287703514098e-06,
"grad_norm": 0.00016495909949298948,
"learning_rate": 2.8652387736823385e-06,
"epoch": 8.939333065488148,
"step": 22250
},
{
"loss": 4.006139934062958e-06,
"grad_norm": 0.0001801540347514674,
"learning_rate": 2.758774606427489e-06,
"epoch": 8.959421454399358,
"step": 22300
},
{
"loss": 4.346966743469239e-06,
"grad_norm": 0.00020672632672358304,
"learning_rate": 2.6542698964848232e-06,
"epoch": 8.979509843310566,
"step": 22350
},
{
"loss": 2.60915607213974e-06,
"grad_norm": 0.000188817095477134,
"learning_rate": 2.55172897846922e-06,
"epoch": 8.999598232221775,
"step": 22400
},
{
"loss": 2.6184692978858947e-06,
"grad_norm": 0.0001020833442453295,
"learning_rate": 2.45115610554198e-06,
"epoch": 9.019686621132985,
"step": 22450
},
{
"loss": 3.1993165612220762e-06,
"grad_norm": 0.00011981981515418738,
"learning_rate": 2.3525554492344115e-06,
"epoch": 9.039775010044194,
"step": 22500
},
{
"eval_seen_loss": 0.012907730415463448,
"eval_seen_accuracy": 0.9980374396135265,
"eval_seen_f1_valid": 0.9984678845020625,
"eval_seen_f1_invalid": 0.9972706277556163,
"eval_seen_macro_f1": 0.9978692561288394,
"eval_seen_majority_baseline": 0.6400966183574879,
"eval_seen_runtime": 0.3224,
"eval_seen_samples_per_second": 20544.851,
"eval_seen_steps_per_second": 161.282,
"epoch": 9.039775010044194,
"step": 22500
},
{
"eval_unseen_loss": 0.048420634120702744,
"eval_unseen_accuracy": 0.9935084541062802,
"eval_unseen_f1_valid": 0.9949429613077737,
"eval_unseen_f1_invalid": 0.9909378292939937,
"eval_unseen_macro_f1": 0.9929403953008837,
"eval_unseen_majority_baseline": 0.6400966183574879,
"eval_unseen_runtime": 0.3203,
"eval_unseen_samples_per_second": 20678.404,
"eval_unseen_steps_per_second": 162.33,
"epoch": 9.039775010044194,
"step": 22500
},
{
"loss": 3.539063036441803e-06,
"grad_norm": 0.00010783238394651562,
"learning_rate": 2.255931099274838e-06,
"epoch": 9.059863398955404,
"step": 22550
},
{
"loss": 5.3878501057624816e-06,
"grad_norm": 0.0001741989835863933,
"learning_rate": 2.161287063418921e-06,
"epoch": 9.079951787866612,
"step": 22600
},
{
"loss": 6.289780139923096e-06,
"grad_norm": 0.0006154667935334146,
"learning_rate": 2.068627267283463e-06,
"epoch": 9.100040176777823,
"step": 22650
},
{
"loss": 2.5946274399757386e-06,
"grad_norm": 0.0003669976722449064,
"learning_rate": 1.9779555541835803e-06,
"epoch": 9.120128565689031,
"step": 22700
},
{
"loss": 2.5730207562446596e-06,
"grad_norm": 0.0001609391183592379,
"learning_rate": 1.8892756849732628e-06,
"epoch": 9.140216954600241,
"step": 22750
},
{
"loss": 5.313083529472351e-06,
"grad_norm": 0.0004570932942442596,
"learning_rate": 1.8025913378893921e-06,
"epoch": 9.16030534351145,
"step": 22800
},
{
"loss": 2.6881694793701173e-06,
"grad_norm": 0.00011044947314076126,
"learning_rate": 1.7179061083992143e-06,
"epoch": 9.18039373242266,
"step": 22850
},
{
"loss": 6.092563271522522e-06,
"grad_norm": 0.00014000650844536722,
"learning_rate": 1.6352235090511482e-06,
"epoch": 9.200482121333868,
"step": 22900
},
{
"loss": 2.402588725090027e-06,
"grad_norm": 0.00012029660138068721,
"learning_rate": 1.5545469693291404e-06,
"epoch": 9.220570510245079,
"step": 22950
},
{
"loss": 2.5689974427223206e-06,
"grad_norm": 0.0001026357349473983,
"learning_rate": 1.4758798355103964e-06,
"epoch": 9.240658899156287,
"step": 23000
},
{
"eval_seen_loss": 0.012925754301249981,
"eval_seen_accuracy": 0.9980374396135265,
"eval_seen_f1_valid": 0.9984678845020625,
"eval_seen_f1_invalid": 0.9972706277556163,
"eval_seen_macro_f1": 0.9978692561288394,
"eval_seen_majority_baseline": 0.6400966183574879,
"eval_seen_runtime": 0.3111,
"eval_seen_samples_per_second": 21289.562,
"eval_seen_steps_per_second": 167.128,
"epoch": 9.240658899156287,
"step": 23000
},
{
"eval_unseen_loss": 0.0486987829208374,
"eval_unseen_accuracy": 0.9935084541062802,
"eval_unseen_f1_valid": 0.9949429613077737,
"eval_unseen_f1_invalid": 0.9909378292939937,
"eval_unseen_macro_f1": 0.9929403953008837,
"eval_unseen_majority_baseline": 0.6400966183574879,
"eval_unseen_runtime": 0.3047,
"eval_unseen_samples_per_second": 21736.906,
"eval_unseen_steps_per_second": 170.64,
"epoch": 9.240658899156287,
"step": 23000
},
{
"loss": 7.318779826164245e-06,
"grad_norm": 9.652505832491443e-05,
"learning_rate": 1.3992253705265913e-06,
"epoch": 9.260747288067497,
"step": 23050
},
{
"loss": 1.061670482158661e-05,
"grad_norm": 0.00011741998605430126,
"learning_rate": 1.3245867538285218e-06,
"epoch": 9.280835676978706,
"step": 23100
},
{
"loss": 2.544894814491272e-06,
"grad_norm": 0.00011236020509386435,
"learning_rate": 1.2519670812542462e-06,
"epoch": 9.300924065889916,
"step": 23150
},
{
"loss": 2.25018709897995e-06,
"grad_norm": 0.00014098426618147641,
"learning_rate": 1.181369364900653e-06,
"epoch": 9.321012454801124,
"step": 23200
},
{
"loss": 2.422593533992767e-06,
"grad_norm": 0.0002591471129562706,
"learning_rate": 1.1127965329985613e-06,
"epoch": 9.341100843712335,
"step": 23250
},
{
"loss": 4.821904003620147e-06,
"grad_norm": 0.00010918612679233775,
"learning_rate": 1.046251429791223e-06,
"epoch": 9.361189232623543,
"step": 23300
},
{
"loss": 2.5689974427223206e-06,
"grad_norm": 9.60305769694969e-05,
"learning_rate": 9.817368154163731e-07,
"epoch": 9.381277621534753,
"step": 23350
},
{
"loss": 2.3266300559043883e-06,
"grad_norm": 0.00010005357034970075,
"learning_rate": 9.192553657917491e-07,
"epoch": 9.401366010445962,
"step": 23400
},
{
"loss": 2.2694468498229982e-06,
"grad_norm": 0.00019680566038005054,
"learning_rate": 8.588096725041017e-07,
"epoch": 9.421454399357172,
"step": 23450
},
{
"loss": 2.3963674902915954e-06,
"grad_norm": 0.00012088896619388834,
"learning_rate": 8.004022427016755e-07,
"epoch": 9.44154278826838,
"step": 23500
},
{
"eval_seen_loss": 0.01295688096433878,
"eval_seen_accuracy": 0.9980374396135265,
"eval_seen_f1_valid": 0.9984678845020625,
"eval_seen_f1_invalid": 0.9972706277556163,
"eval_seen_macro_f1": 0.9978692561288394,
"eval_seen_majority_baseline": 0.6400966183574879,
"eval_seen_runtime": 0.3169,
"eval_seen_samples_per_second": 20904.426,
"eval_seen_steps_per_second": 164.105,
"epoch": 9.44154278826838,
"step": 23500
},
{
"eval_unseen_loss": 0.04889357462525368,
"eval_unseen_accuracy": 0.9935084541062802,
"eval_unseen_f1_valid": 0.9949429613077737,
"eval_unseen_f1_invalid": 0.9909378292939937,
"eval_unseen_macro_f1": 0.9929403953008837,
"eval_unseen_majority_baseline": 0.6400966183574879,
"eval_unseen_runtime": 0.3124,
"eval_unseen_samples_per_second": 21200.326,
"eval_unseen_steps_per_second": 166.428,
"epoch": 9.44154278826838,
"step": 23500
},
{
"loss": 2.274066209793091e-06,
"grad_norm": 0.00013658883108291775,
"learning_rate": 7.440354989902476e-07,
"epoch": 9.46163117717959,
"step": 23550
},
{
"loss": 2.394132316112518e-06,
"grad_norm": 9.553777636028826e-05,
"learning_rate": 6.897117793326246e-07,
"epoch": 9.4817195660908,
"step": 23600
},
{
"loss": 2.231821417808533e-06,
"grad_norm": 9.738129301695153e-05,
"learning_rate": 6.374333369516816e-07,
"epoch": 9.50180795500201,
"step": 23650
},
{
"loss": 2.571381628513336e-06,
"grad_norm": 0.00044456496834754944,
"learning_rate": 5.872023402369086e-07,
"epoch": 9.521896343913218,
"step": 23700
},
{
"loss": 9.307749569416047e-06,
"grad_norm": 0.00010363019828218967,
"learning_rate": 5.390208726544388e-07,
"epoch": 9.541984732824428,
"step": 23750
},
{
"loss": 2.765655517578125e-06,
"grad_norm": 0.0001128022704506293,
"learning_rate": 4.928909326606779e-07,
"epoch": 9.562073121735637,
"step": 23800
},
{
"loss": 4.050321877002716e-06,
"grad_norm": 0.00010679530532797799,
"learning_rate": 4.4881443361936557e-07,
"epoch": 9.582161510646847,
"step": 23850
},
{
"loss": 2.3236870765686035e-06,
"grad_norm": 0.00013532352750189602,
"learning_rate": 4.0679320372226105e-07,
"epoch": 9.602249899558055,
"step": 23900
},
{
"loss": 2.273358404636383e-06,
"grad_norm": 0.00011449832527432591,
"learning_rate": 3.668289859132701e-07,
"epoch": 9.622338288469265,
"step": 23950
},
{
"loss": 2.487748861312866e-06,
"grad_norm": 0.00010196401854045689,
"learning_rate": 3.289234378161754e-07,
"epoch": 9.642426677380474,
"step": 24000
},
{
"eval_seen_loss": 0.012985438108444214,
"eval_seen_accuracy": 0.9980374396135265,
"eval_seen_f1_valid": 0.9984678845020625,
"eval_seen_f1_invalid": 0.9972706277556163,
"eval_seen_macro_f1": 0.9978692561288394,
"eval_seen_majority_baseline": 0.6400966183574879,
"eval_seen_runtime": 0.315,
"eval_seen_samples_per_second": 21031.688,
"eval_seen_steps_per_second": 165.104,
"epoch": 9.642426677380474,
"step": 24000
},
{
"eval_unseen_loss": 0.049161944538354874,
"eval_unseen_accuracy": 0.9935084541062802,
"eval_unseen_f1_valid": 0.9949429613077737,
"eval_unseen_f1_invalid": 0.9909378292939937,
"eval_unseen_macro_f1": 0.9929403953008837,
"eval_unseen_majority_baseline": 0.6400966183574879,
"eval_unseen_runtime": 0.3049,
"eval_unseen_samples_per_second": 21728.287,
"eval_unseen_steps_per_second": 170.572,
"epoch": 9.642426677380474,
"step": 24000
},
{
"loss": 2.380460500717163e-06,
"grad_norm": 8.719210018170998e-05,
"learning_rate": 2.9307813166588036e-07,
"epoch": 9.662515066291684,
"step": 24050
},
{
"loss": 3.890357911586761e-06,
"grad_norm": 0.00022959259513299912,
"learning_rate": 2.592945542431946e-07,
"epoch": 9.682603455202893,
"step": 24100
},
{
"loss": 2.6455894112586974e-06,
"grad_norm": 0.0001019965493469499,
"learning_rate": 2.2757410681315537e-07,
"epoch": 9.702691844114103,
"step": 24150
},
{
"loss": 2.2900477051734925e-06,
"grad_norm": 0.00013137496716808528,
"learning_rate": 1.9791810506693542e-07,
"epoch": 9.722780233025311,
"step": 24200
},
{
"loss": 2.7436017990112305e-06,
"grad_norm": 9.810757910599932e-05,
"learning_rate": 1.7032777906723087e-07,
"epoch": 9.742868621936521,
"step": 24250
},
{
"loss": 2.2519752383232116e-06,
"grad_norm": 0.00012141554907429963,
"learning_rate": 1.4480427319726875e-07,
"epoch": 9.76295701084773,
"step": 24300
},
{
"loss": 2.942308783531189e-06,
"grad_norm": 0.00010106329864356667,
"learning_rate": 1.2134864611333952e-07,
"epoch": 9.78304539975894,
"step": 24350
},
{
"loss": 4.490092396736145e-06,
"grad_norm": 0.000193135958397761,
"learning_rate": 9.996187070087648e-08,
"epoch": 9.803133788670149,
"step": 24400
},
{
"loss": 2.4335458874702454e-06,
"grad_norm": 0.0001166210204246454,
"learning_rate": 8.064483403410483e-08,
"epoch": 9.823222177581357,
"step": 24450
},
{
"loss": 2.541393041610718e-06,
"grad_norm": 8.921896369429305e-05,
"learning_rate": 6.339833733924327e-08,
"epoch": 9.843310566492567,
"step": 24500
},
{
"eval_seen_loss": 0.013017052784562111,
"eval_seen_accuracy": 0.9980374396135265,
"eval_seen_f1_valid": 0.9984678845020625,
"eval_seen_f1_invalid": 0.9972706277556163,
"eval_seen_macro_f1": 0.9978692561288394,
"eval_seen_majority_baseline": 0.6400966183574879,
"eval_seen_runtime": 0.3165,
"eval_seen_samples_per_second": 20925.887,
"eval_seen_steps_per_second": 164.273,
"epoch": 9.843310566492567,
"step": 24500
},
{
"eval_unseen_loss": 0.04933434724807739,
"eval_unseen_accuracy": 0.9935084541062802,
"eval_unseen_f1_valid": 0.9949429613077737,
"eval_unseen_f1_invalid": 0.9909378292939937,
"eval_unseen_macro_f1": 0.9929403953008837,
"eval_unseen_majority_baseline": 0.6400966183574879,
"eval_unseen_runtime": 0.3035,
"eval_unseen_samples_per_second": 21822.375,
"eval_unseen_steps_per_second": 171.311,
"epoch": 9.843310566492567,
"step": 24500
},
{
"loss": 2.145916223526001e-06,
"grad_norm": 9.508332004770637e-05,
"learning_rate": 4.8223095961297257e-08,
"epoch": 9.863398955403778,
"step": 24550
},
{
"loss": 2.3793429136276247e-06,
"grad_norm": 0.00017216239939443767,
"learning_rate": 3.511973933434942e-08,
"epoch": 9.883487344314986,
"step": 24600
},
{
"loss": 3.3716857433319093e-06,
"grad_norm": 0.00010370145901106298,
"learning_rate": 2.4088810955474883e-08,
"epoch": 9.903575733226194,
"step": 24650
},
{
"loss": 2.418123185634613e-06,
"grad_norm": 0.00010311349615221843,
"learning_rate": 1.513076836220373e-08,
"epoch": 9.923664122137405,
"step": 24700
},
{
"loss": 2.4419650435447693e-06,
"grad_norm": 9.561217302689329e-05,
"learning_rate": 8.24598311352509e-09,
"epoch": 9.943752511048613,
"step": 24750
},
{
"loss": 2.808086574077606e-06,
"grad_norm": 0.00010774183465400711,
"learning_rate": 3.434740774482803e-09,
"epoch": 9.963840899959823,
"step": 24800
},
{
"loss": 4.667192697525024e-06,
"grad_norm": 9.36409633141011e-05,
"learning_rate": 6.972409043404238e-10,
"epoch": 9.983929288871032,
"step": 24850
},
{
"eval_seen_loss": 0.013024607673287392,
"eval_seen_accuracy": 0.9980374396135265,
"eval_seen_f1_valid": 0.9984678845020625,
"eval_seen_f1_invalid": 0.9972706277556163,
"eval_seen_macro_f1": 0.9978692561288394,
"eval_seen_majority_baseline": 0.6400966183574879,
"eval_seen_runtime": 0.3177,
"eval_seen_samples_per_second": 20853.119,
"eval_seen_steps_per_second": 163.702,
"epoch": 10.0,
"step": 24890
},
{
"eval_unseen_loss": 0.0492788590490818,
"eval_unseen_accuracy": 0.9935084541062802,
"eval_unseen_f1_valid": 0.9949429613077737,
"eval_unseen_f1_invalid": 0.9909378292939937,
"eval_unseen_macro_f1": 0.9929403953008837,
"eval_unseen_majority_baseline": 0.6400966183574879,
"eval_unseen_runtime": 0.3068,
"eval_unseen_samples_per_second": 21589.715,
"eval_unseen_steps_per_second": 169.484,
"epoch": 10.0,
"step": 24890
},
{
"train_runtime": 222.8072,
"train_samples_per_second": 7146.985,
"train_steps_per_second": 111.711,
"total_flos": 1015596244174848.0,
"train_loss": 0.01661168186644346,
"epoch": 10.0,
"step": 24890
},
{
"eval_seen_loss": 0.011836923658847809,
"eval_seen_accuracy": 0.9978864734299517,
"eval_seen_f1_valid": 0.9983498349834984,
"eval_seen_f1_invalid": 0.9970612930310664,
"eval_seen_macro_f1": 0.9977055640072824,
"eval_seen_majority_baseline": 0.6400966183574879,
"eval_seen_runtime": 0.3194,
"eval_seen_samples_per_second": 20735.801,
"eval_seen_steps_per_second": 162.781,
"epoch": 10.0,
"step": 24890
},
{
"eval_unseen_loss": 0.04228868708014488,
"eval_unseen_accuracy": 0.9947161835748792,
"eval_unseen_f1_valid": 0.9958808991408732,
"eval_unseen_f1_invalid": 0.9926331298673964,
"eval_unseen_macro_f1": 0.9942570145041347,
"eval_unseen_majority_baseline": 0.6400966183574879,
"eval_unseen_runtime": 0.3081,
"eval_unseen_samples_per_second": 21497.784,
"eval_unseen_steps_per_second": 168.763,
"epoch": 10.0,
"step": 24890
}
]
}