Text Classification
Transformers
Safetensors
Arabic
llama
arabic
rule-checking
compliance
moderation
tiny-model
on-device
text-embeddings-inference
Instructions to use oddadmix/Nawah-RuleCheck-5M with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use oddadmix/Nawah-RuleCheck-5M with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-classification", model="oddadmix/Nawah-RuleCheck-5M")# Load model directly from transformers import AutoTokenizer, AutoModelForSequenceClassification tokenizer = AutoTokenizer.from_pretrained("oddadmix/Nawah-RuleCheck-5M") model = AutoModelForSequenceClassification.from_pretrained("oddadmix/Nawah-RuleCheck-5M", device_map="auto") - Notebooks
- Google Colab
- Kaggle
| { | |
| "final_eval": { | |
| "eval_seen_loss": 0.011836923658847809, | |
| "eval_seen_accuracy": 0.9978864734299517, | |
| "eval_seen_f1_valid": 0.9983498349834984, | |
| "eval_seen_f1_invalid": 0.9970612930310664, | |
| "eval_seen_macro_f1": 0.9977055640072824, | |
| "eval_seen_majority_baseline": 0.6400966183574879, | |
| "eval_seen_runtime": 0.3194, | |
| "eval_seen_samples_per_second": 20735.801, | |
| "eval_seen_steps_per_second": 162.781, | |
| "epoch": 10.0, | |
| "eval_unseen_loss": 0.04228868708014488, | |
| "eval_unseen_accuracy": 0.9947161835748792, | |
| "eval_unseen_f1_valid": 0.9958808991408732, | |
| "eval_unseen_f1_invalid": 0.9926331298673964, | |
| "eval_unseen_macro_f1": 0.9942570145041347, | |
| "eval_unseen_majority_baseline": 0.6400966183574879, | |
| "eval_unseen_runtime": 0.3081, | |
| "eval_unseen_samples_per_second": 21497.784, | |
| "eval_unseen_steps_per_second": 168.763 | |
| }, | |
| "per_rule": { | |
| "seen": { | |
| "has_city": { | |
| "acc": 0.9907, | |
| "n": 648 | |
| }, | |
| "no_excess_punct": { | |
| "acc": 0.9985, | |
| "n": 647 | |
| }, | |
| "no_phone": { | |
| "acc": 1.0, | |
| "n": 471 | |
| }, | |
| "has_phone": { | |
| "acc": 1.0, | |
| "n": 524 | |
| }, | |
| "has_price": { | |
| "acc": 1.0, | |
| "n": 521 | |
| }, | |
| "no_email": { | |
| "acc": 1.0, | |
| "n": 682 | |
| }, | |
| "no_url": { | |
| "acc": 1.0, | |
| "n": 513 | |
| }, | |
| "has_date": { | |
| "acc": 0.9982, | |
| "n": 560 | |
| }, | |
| "ends_question": { | |
| "acc": 1.0, | |
| "n": 621 | |
| }, | |
| "no_latin": { | |
| "acc": 1.0, | |
| "n": 638 | |
| }, | |
| "has_number": { | |
| "acc": 1.0, | |
| "n": 511 | |
| }, | |
| "max_words_30": { | |
| "acc": 1.0, | |
| "n": 46 | |
| }, | |
| "min_words_25": { | |
| "acc": 1.0, | |
| "n": 40 | |
| }, | |
| "min_words_15": { | |
| "acc": 0.9762, | |
| "n": 42 | |
| }, | |
| "max_words_50": { | |
| "acc": 0.9767, | |
| "n": 43 | |
| }, | |
| "min_words_20": { | |
| "acc": 0.9714, | |
| "n": 35 | |
| }, | |
| "max_words_25": { | |
| "acc": 1.0, | |
| "n": 20 | |
| }, | |
| "min_words_30": { | |
| "acc": 0.9744, | |
| "n": 39 | |
| }, | |
| "max_words_40": { | |
| "acc": 0.913, | |
| "n": 23 | |
| } | |
| }, | |
| "unseen": { | |
| "has_city": { | |
| "acc": 0.9938, | |
| "n": 648 | |
| }, | |
| "no_excess_punct": { | |
| "acc": 0.9985, | |
| "n": 647 | |
| }, | |
| "no_phone": { | |
| "acc": 0.9639, | |
| "n": 471 | |
| }, | |
| "has_phone": { | |
| "acc": 1.0, | |
| "n": 524 | |
| }, | |
| "has_price": { | |
| "acc": 1.0, | |
| "n": 521 | |
| }, | |
| "no_email": { | |
| "acc": 1.0, | |
| "n": 682 | |
| }, | |
| "no_url": { | |
| "acc": 1.0, | |
| "n": 513 | |
| }, | |
| "has_date": { | |
| "acc": 0.9982, | |
| "n": 560 | |
| }, | |
| "ends_question": { | |
| "acc": 1.0, | |
| "n": 621 | |
| }, | |
| "no_latin": { | |
| "acc": 0.9969, | |
| "n": 638 | |
| }, | |
| "has_number": { | |
| "acc": 1.0, | |
| "n": 511 | |
| }, | |
| "max_words_30": { | |
| "acc": 0.9783, | |
| "n": 46 | |
| }, | |
| "min_words_25": { | |
| "acc": 1.0, | |
| "n": 40 | |
| }, | |
| "min_words_15": { | |
| "acc": 0.9762, | |
| "n": 42 | |
| }, | |
| "max_words_50": { | |
| "acc": 0.9767, | |
| "n": 43 | |
| }, | |
| "min_words_20": { | |
| "acc": 0.9429, | |
| "n": 35 | |
| }, | |
| "max_words_25": { | |
| "acc": 0.95, | |
| "n": 20 | |
| }, | |
| "min_words_30": { | |
| "acc": 0.9487, | |
| "n": 39 | |
| }, | |
| "max_words_40": { | |
| "acc": 0.913, | |
| "n": 23 | |
| } | |
| } | |
| }, | |
| "log_history": [ | |
| { | |
| "loss": 0.6704658508300781, | |
| "grad_norm": 6.961378574371338, | |
| "learning_rate": 9.800000000000001e-06, | |
| "epoch": 0.020088388911209322, | |
| "step": 50 | |
| }, | |
| { | |
| "loss": 0.6055447769165039, | |
| "grad_norm": 6.502827167510986, | |
| "learning_rate": 1.9800000000000004e-05, | |
| "epoch": 0.040176777822418644, | |
| "step": 100 | |
| }, | |
| { | |
| "loss": 0.5635388946533203, | |
| "grad_norm": 10.348727226257324, | |
| "learning_rate": 2.98e-05, | |
| "epoch": 0.060265166733627966, | |
| "step": 150 | |
| }, | |
| { | |
| "loss": 0.49288463592529297, | |
| "grad_norm": 8.155802726745605, | |
| "learning_rate": 3.9800000000000005e-05, | |
| "epoch": 0.08035355564483729, | |
| "step": 200 | |
| }, | |
| { | |
| "loss": 0.3849527359008789, | |
| "grad_norm": 7.203456878662109, | |
| "learning_rate": 4.9800000000000004e-05, | |
| "epoch": 0.1004419445560466, | |
| "step": 250 | |
| }, | |
| { | |
| "loss": 0.2943598365783691, | |
| "grad_norm": 5.37825345993042, | |
| "learning_rate": 5.9800000000000003e-05, | |
| "epoch": 0.12053033346725593, | |
| "step": 300 | |
| }, | |
| { | |
| "loss": 0.2564892578125, | |
| "grad_norm": 10.878361701965332, | |
| "learning_rate": 6.98e-05, | |
| "epoch": 0.14061872237846526, | |
| "step": 350 | |
| }, | |
| { | |
| "loss": 0.21619060516357422, | |
| "grad_norm": 9.906046867370605, | |
| "learning_rate": 7.98e-05, | |
| "epoch": 0.16070711128967458, | |
| "step": 400 | |
| }, | |
| { | |
| "loss": 0.20003364562988282, | |
| "grad_norm": 4.608164310455322, | |
| "learning_rate": 8.98e-05, | |
| "epoch": 0.1807955002008839, | |
| "step": 450 | |
| }, | |
| { | |
| "loss": 0.17786117553710937, | |
| "grad_norm": 12.025157928466797, | |
| "learning_rate": 9.98e-05, | |
| "epoch": 0.2008838891120932, | |
| "step": 500 | |
| }, | |
| { | |
| "eval_seen_loss": 0.15569795668125153, | |
| "eval_seen_accuracy": 0.9334239130434783, | |
| "eval_seen_f1_valid": 0.9492461733225918, | |
| "eval_seen_f1_invalid": 0.9032682605834613, | |
| "eval_seen_macro_f1": 0.9262572169530265, | |
| "eval_seen_majority_baseline": 0.6400966183574879, | |
| "eval_seen_runtime": 0.3266, | |
| "eval_seen_samples_per_second": 20283.255, | |
| "eval_seen_steps_per_second": 159.228, | |
| "epoch": 0.2008838891120932, | |
| "step": 500 | |
| }, | |
| { | |
| "eval_unseen_loss": 0.20032644271850586, | |
| "eval_unseen_accuracy": 0.9172705314009661, | |
| "eval_unseen_f1_valid": 0.9373571101966164, | |
| "eval_unseen_f1_invalid": 0.8782222222222221, | |
| "eval_unseen_macro_f1": 0.9077896662094193, | |
| "eval_unseen_majority_baseline": 0.6400966183574879, | |
| "eval_unseen_runtime": 0.3075, | |
| "eval_unseen_samples_per_second": 21539.634, | |
| "eval_unseen_steps_per_second": 169.091, | |
| "epoch": 0.2008838891120932, | |
| "step": 500 | |
| }, | |
| { | |
| "loss": 0.16435718536376953, | |
| "grad_norm": 2.128711462020874, | |
| "learning_rate": 9.999900412031836e-05, | |
| "epoch": 0.22097227802330252, | |
| "step": 550 | |
| }, | |
| { | |
| "loss": 0.15185343742370605, | |
| "grad_norm": 5.858470439910889, | |
| "learning_rate": 9.999593481178791e-05, | |
| "epoch": 0.24106066693451186, | |
| "step": 600 | |
| }, | |
| { | |
| "loss": 0.1407579231262207, | |
| "grad_norm": 8.060696601867676, | |
| "learning_rate": 9.999079178693804e-05, | |
| "epoch": 0.2611490558457212, | |
| "step": 650 | |
| }, | |
| { | |
| "loss": 0.13899617195129393, | |
| "grad_norm": 2.430171489715576, | |
| "learning_rate": 9.998357525908964e-05, | |
| "epoch": 0.2812374447569305, | |
| "step": 700 | |
| }, | |
| { | |
| "loss": 0.12171868324279785, | |
| "grad_norm": 6.015133857727051, | |
| "learning_rate": 9.997428552756763e-05, | |
| "epoch": 0.3013258336681398, | |
| "step": 750 | |
| }, | |
| { | |
| "loss": 0.11208045959472657, | |
| "grad_norm": 5.097869873046875, | |
| "learning_rate": 9.996292297768872e-05, | |
| "epoch": 0.32141422257934915, | |
| "step": 800 | |
| }, | |
| { | |
| "loss": 0.08406662940979004, | |
| "grad_norm": 3.9282870292663574, | |
| "learning_rate": 9.994948808074534e-05, | |
| "epoch": 0.34150261149055844, | |
| "step": 850 | |
| }, | |
| { | |
| "loss": 0.08543995857238769, | |
| "grad_norm": 1.9250595569610596, | |
| "learning_rate": 9.993398139398606e-05, | |
| "epoch": 0.3615910004017678, | |
| "step": 900 | |
| }, | |
| { | |
| "loss": 0.10277658462524414, | |
| "grad_norm": 3.51467227935791, | |
| "learning_rate": 9.991640356059261e-05, | |
| "epoch": 0.3816793893129771, | |
| "step": 950 | |
| }, | |
| { | |
| "loss": 0.08797937393188476, | |
| "grad_norm": 5.154219150543213, | |
| "learning_rate": 9.989675530965303e-05, | |
| "epoch": 0.4017677782241864, | |
| "step": 1000 | |
| }, | |
| { | |
| "eval_seen_loss": 0.07947713881731033, | |
| "eval_seen_accuracy": 0.9719202898550725, | |
| "eval_seen_f1_valid": 0.9782710280373832, | |
| "eval_seen_f1_invalid": 0.9603242320819113, | |
| "eval_seen_macro_f1": 0.9692976300596472, | |
| "eval_seen_majority_baseline": 0.6400966183574879, | |
| "eval_seen_runtime": 0.3186, | |
| "eval_seen_samples_per_second": 20791.68, | |
| "eval_seen_steps_per_second": 163.22, | |
| "epoch": 0.4017677782241864, | |
| "step": 1000 | |
| }, | |
| { | |
| "eval_unseen_loss": 0.12618499994277954, | |
| "eval_unseen_accuracy": 0.9581823671497585, | |
| "eval_unseen_f1_valid": 0.967522570055106, | |
| "eval_unseen_f1_invalid": 0.9413011231193049, | |
| "eval_unseen_macro_f1": 0.9544118465872055, | |
| "eval_unseen_majority_baseline": 0.6400966183574879, | |
| "eval_unseen_runtime": 0.2981, | |
| "eval_unseen_samples_per_second": 22222.687, | |
| "eval_unseen_steps_per_second": 174.453, | |
| "epoch": 0.4017677782241864, | |
| "step": 1000 | |
| }, | |
| { | |
| "loss": 0.07849720478057862, | |
| "grad_norm": 2.367215633392334, | |
| "learning_rate": 9.987503745613157e-05, | |
| "epoch": 0.42185616713539575, | |
| "step": 1050 | |
| }, | |
| { | |
| "loss": 0.06738131999969482, | |
| "grad_norm": 0.9078812003135681, | |
| "learning_rate": 9.985125090083481e-05, | |
| "epoch": 0.44194455604660504, | |
| "step": 1100 | |
| }, | |
| { | |
| "loss": 0.05828128814697266, | |
| "grad_norm": 3.2039096355438232, | |
| "learning_rate": 9.982539663037431e-05, | |
| "epoch": 0.4620329449578144, | |
| "step": 1150 | |
| }, | |
| { | |
| "loss": 0.07166430950164795, | |
| "grad_norm": 3.850139617919922, | |
| "learning_rate": 9.979747571712573e-05, | |
| "epoch": 0.4821213338690237, | |
| "step": 1200 | |
| }, | |
| { | |
| "loss": 0.061166787147521974, | |
| "grad_norm": 12.084016799926758, | |
| "learning_rate": 9.976748931918429e-05, | |
| "epoch": 0.502209722780233, | |
| "step": 1250 | |
| }, | |
| { | |
| "loss": 0.05616282939910889, | |
| "grad_norm": 3.185512065887451, | |
| "learning_rate": 9.973543868031676e-05, | |
| "epoch": 0.5222981116914424, | |
| "step": 1300 | |
| }, | |
| { | |
| "loss": 0.04871833324432373, | |
| "grad_norm": 3.6474103927612305, | |
| "learning_rate": 9.970132512990988e-05, | |
| "epoch": 0.5423865006026517, | |
| "step": 1350 | |
| }, | |
| { | |
| "loss": 0.04807154655456543, | |
| "grad_norm": 2.4606831073760986, | |
| "learning_rate": 9.966515008291524e-05, | |
| "epoch": 0.562474889513861, | |
| "step": 1400 | |
| }, | |
| { | |
| "loss": 0.04073795795440674, | |
| "grad_norm": 1.6424299478530884, | |
| "learning_rate": 9.962691503979052e-05, | |
| "epoch": 0.5825632784250703, | |
| "step": 1450 | |
| }, | |
| { | |
| "loss": 0.05464828491210937, | |
| "grad_norm": 0.40458548069000244, | |
| "learning_rate": 9.95866215864373e-05, | |
| "epoch": 0.6026516673362796, | |
| "step": 1500 | |
| }, | |
| { | |
| "eval_seen_loss": 0.04147813469171524, | |
| "eval_seen_accuracy": 0.9877717391304348, | |
| "eval_seen_f1_valid": 0.9904357066950054, | |
| "eval_seen_f1_invalid": 0.9830508474576272, | |
| "eval_seen_macro_f1": 0.9867432770763163, | |
| "eval_seen_majority_baseline": 0.6400966183574879, | |
| "eval_seen_runtime": 0.3165, | |
| "eval_seen_samples_per_second": 20927.195, | |
| "eval_seen_steps_per_second": 164.284, | |
| "epoch": 0.6026516673362796, | |
| "step": 1500 | |
| }, | |
| { | |
| "eval_unseen_loss": 0.08285732567310333, | |
| "eval_unseen_accuracy": 0.9770531400966184, | |
| "eval_unseen_f1_valid": 0.9819990525817148, | |
| "eval_unseen_f1_invalid": 0.9683597002497918, | |
| "eval_unseen_macro_f1": 0.9751793764157533, | |
| "eval_unseen_majority_baseline": 0.6400966183574879, | |
| "eval_unseen_runtime": 0.3155, | |
| "eval_unseen_samples_per_second": 20994.308, | |
| "eval_unseen_steps_per_second": 164.81, | |
| "epoch": 0.6026516673362796, | |
| "step": 1500 | |
| }, | |
| { | |
| "loss": 0.04056734085083008, | |
| "grad_norm": 19.595773696899414, | |
| "learning_rate": 9.954427139413534e-05, | |
| "epoch": 0.622740056247489, | |
| "step": 1550 | |
| }, | |
| { | |
| "loss": 0.039789986610412595, | |
| "grad_norm": 2.786728858947754, | |
| "learning_rate": 9.949986621947312e-05, | |
| "epoch": 0.6428284451586983, | |
| "step": 1600 | |
| }, | |
| { | |
| "loss": 0.03137856245040894, | |
| "grad_norm": 1.161686658859253, | |
| "learning_rate": 9.94534079042751e-05, | |
| "epoch": 0.6629168340699076, | |
| "step": 1650 | |
| }, | |
| { | |
| "loss": 0.0490680456161499, | |
| "grad_norm": 0.8502035140991211, | |
| "learning_rate": 9.94048983755253e-05, | |
| "epoch": 0.6830052229811169, | |
| "step": 1700 | |
| }, | |
| { | |
| "loss": 0.036091387271881104, | |
| "grad_norm": 2.027765989303589, | |
| "learning_rate": 9.93543396452873e-05, | |
| "epoch": 0.7030936118923262, | |
| "step": 1750 | |
| }, | |
| { | |
| "loss": 0.03713906049728394, | |
| "grad_norm": 1.404341697692871, | |
| "learning_rate": 9.930173381062093e-05, | |
| "epoch": 0.7231820008035356, | |
| "step": 1800 | |
| }, | |
| { | |
| "loss": 0.035144150257110596, | |
| "grad_norm": 0.33481183648109436, | |
| "learning_rate": 9.924708305349509e-05, | |
| "epoch": 0.7432703897147449, | |
| "step": 1850 | |
| }, | |
| { | |
| "loss": 0.038848557472229005, | |
| "grad_norm": 4.593264579772949, | |
| "learning_rate": 9.919038964069746e-05, | |
| "epoch": 0.7633587786259542, | |
| "step": 1900 | |
| }, | |
| { | |
| "loss": 0.03796250820159912, | |
| "grad_norm": 2.970884084701538, | |
| "learning_rate": 9.913165592374031e-05, | |
| "epoch": 0.7834471675371635, | |
| "step": 1950 | |
| }, | |
| { | |
| "loss": 0.030259652137756346, | |
| "grad_norm": 0.5110931992530823, | |
| "learning_rate": 9.907088433876308e-05, | |
| "epoch": 0.8035355564483728, | |
| "step": 2000 | |
| }, | |
| { | |
| "eval_seen_loss": 0.03181261196732521, | |
| "eval_seen_accuracy": 0.9907910628019324, | |
| "eval_seen_f1_valid": 0.9928344884294608, | |
| "eval_seen_f1_invalid": 0.9871172122492081, | |
| "eval_seen_macro_f1": 0.9899758503393344, | |
| "eval_seen_majority_baseline": 0.6400966183574879, | |
| "eval_seen_runtime": 0.3228, | |
| "eval_seen_samples_per_second": 20519.36, | |
| "eval_seen_steps_per_second": 161.082, | |
| "epoch": 0.8035355564483728, | |
| "step": 2000 | |
| }, | |
| { | |
| "eval_unseen_loss": 0.09161130338907242, | |
| "eval_unseen_accuracy": 0.9781099033816425, | |
| "eval_unseen_f1_valid": 0.9830270396816106, | |
| "eval_unseen_f1_invalid": 0.9691817215727949, | |
| "eval_unseen_macro_f1": 0.9761043806272027, | |
| "eval_unseen_majority_baseline": 0.6400966183574879, | |
| "eval_unseen_runtime": 0.3041, | |
| "eval_unseen_samples_per_second": 21783.433, | |
| "eval_unseen_steps_per_second": 171.005, | |
| "epoch": 0.8035355564483728, | |
| "step": 2000 | |
| }, | |
| { | |
| "loss": 0.027805449962615966, | |
| "grad_norm": 0.061120375990867615, | |
| "learning_rate": 9.900807740643124e-05, | |
| "epoch": 0.8236239453595822, | |
| "step": 2050 | |
| }, | |
| { | |
| "loss": 0.03178966760635376, | |
| "grad_norm": 0.05971622094511986, | |
| "learning_rate": 9.894323773183181e-05, | |
| "epoch": 0.8437123342707915, | |
| "step": 2100 | |
| }, | |
| { | |
| "loss": 0.03385076999664307, | |
| "grad_norm": 0.3821258544921875, | |
| "learning_rate": 9.887636800436526e-05, | |
| "epoch": 0.8638007231820009, | |
| "step": 2150 | |
| }, | |
| { | |
| "loss": 0.03567046165466309, | |
| "grad_norm": 0.27875784039497375, | |
| "learning_rate": 9.880747099763402e-05, | |
| "epoch": 0.8838891120932101, | |
| "step": 2200 | |
| }, | |
| { | |
| "loss": 0.026896452903747557, | |
| "grad_norm": 0.13735617697238922, | |
| "learning_rate": 9.873654956932737e-05, | |
| "epoch": 0.9039775010044194, | |
| "step": 2250 | |
| }, | |
| { | |
| "loss": 0.0216548752784729, | |
| "grad_norm": 0.14634734392166138, | |
| "learning_rate": 9.866360666110293e-05, | |
| "epoch": 0.9240658899156288, | |
| "step": 2300 | |
| }, | |
| { | |
| "loss": 0.028975086212158205, | |
| "grad_norm": 7.620655059814453, | |
| "learning_rate": 9.858864529846467e-05, | |
| "epoch": 0.9441542788268381, | |
| "step": 2350 | |
| }, | |
| { | |
| "loss": 0.030748412609100342, | |
| "grad_norm": 2.8802390098571777, | |
| "learning_rate": 9.851166859063744e-05, | |
| "epoch": 0.9642426677380475, | |
| "step": 2400 | |
| }, | |
| { | |
| "loss": 0.026972088813781738, | |
| "grad_norm": 5.01859188079834, | |
| "learning_rate": 9.843267973043787e-05, | |
| "epoch": 0.9843310566492567, | |
| "step": 2450 | |
| }, | |
| { | |
| "loss": 0.025179855823516846, | |
| "grad_norm": 0.2297878861427307, | |
| "learning_rate": 9.835168199414214e-05, | |
| "epoch": 1.004419445560466, | |
| "step": 2500 | |
| }, | |
| { | |
| "eval_seen_loss": 0.023833297193050385, | |
| "eval_seen_accuracy": 0.9944142512077294, | |
| "eval_seen_f1_valid": 0.9956414183060431, | |
| "eval_seen_f1_invalid": 0.9922252574070183, | |
| "eval_seen_macro_f1": 0.9939333378565307, | |
| "eval_seen_majority_baseline": 0.6400966183574879, | |
| "eval_seen_runtime": 0.3285, | |
| "eval_seen_samples_per_second": 20167.338, | |
| "eval_seen_steps_per_second": 158.318, | |
| "epoch": 1.004419445560466, | |
| "step": 2500 | |
| }, | |
| { | |
| "eval_unseen_loss": 0.06532388180494308, | |
| "eval_unseen_accuracy": 0.9844504830917874, | |
| "eval_unseen_f1_valid": 0.9878695088917677, | |
| "eval_unseen_f1_invalid": 0.978347698129073, | |
| "eval_unseen_macro_f1": 0.9831086035104204, | |
| "eval_unseen_majority_baseline": 0.6400966183574879, | |
| "eval_unseen_runtime": 0.3064, | |
| "eval_unseen_samples_per_second": 21618.559, | |
| "eval_unseen_steps_per_second": 169.711, | |
| "epoch": 1.004419445560466, | |
| "step": 2500 | |
| }, | |
| { | |
| "loss": 0.025775249004364013, | |
| "grad_norm": 1.0400502681732178, | |
| "learning_rate": 9.826867874134995e-05, | |
| "epoch": 1.0245078344716754, | |
| "step": 2550 | |
| }, | |
| { | |
| "loss": 0.0226438307762146, | |
| "grad_norm": 1.6363939046859741, | |
| "learning_rate": 9.81836734148452e-05, | |
| "epoch": 1.0445962233828847, | |
| "step": 2600 | |
| }, | |
| { | |
| "loss": 0.01809248685836792, | |
| "grad_norm": 0.01623135432600975, | |
| "learning_rate": 9.809666954045322e-05, | |
| "epoch": 1.064684612294094, | |
| "step": 2650 | |
| }, | |
| { | |
| "loss": 0.021049981117248536, | |
| "grad_norm": 0.021346036344766617, | |
| "learning_rate": 9.800767072689449e-05, | |
| "epoch": 1.0847730012053034, | |
| "step": 2700 | |
| }, | |
| { | |
| "loss": 0.026336238384246827, | |
| "grad_norm": 0.03480149060487747, | |
| "learning_rate": 9.791668066563497e-05, | |
| "epoch": 1.1048613901165127, | |
| "step": 2750 | |
| }, | |
| { | |
| "loss": 0.01243409514427185, | |
| "grad_norm": 0.07298510521650314, | |
| "learning_rate": 9.782370313073301e-05, | |
| "epoch": 1.1249497790277219, | |
| "step": 2800 | |
| }, | |
| { | |
| "loss": 0.015609384775161743, | |
| "grad_norm": 0.09682580828666687, | |
| "learning_rate": 9.77287419786828e-05, | |
| "epoch": 1.1450381679389312, | |
| "step": 2850 | |
| }, | |
| { | |
| "loss": 0.015297083854675294, | |
| "grad_norm": 0.5698757767677307, | |
| "learning_rate": 9.763180114825439e-05, | |
| "epoch": 1.1651265568501405, | |
| "step": 2900 | |
| }, | |
| { | |
| "loss": 0.00734399139881134, | |
| "grad_norm": 0.009613298811018467, | |
| "learning_rate": 9.753288466033033e-05, | |
| "epoch": 1.18521494576135, | |
| "step": 2950 | |
| }, | |
| { | |
| "loss": 0.025555052757263184, | |
| "grad_norm": 0.05337614193558693, | |
| "learning_rate": 9.743199661773888e-05, | |
| "epoch": 1.2053033346725592, | |
| "step": 3000 | |
| }, | |
| { | |
| "eval_seen_loss": 0.03496118634939194, | |
| "eval_seen_accuracy": 0.9909420289855072, | |
| "eval_seen_f1_valid": 0.9929295309922225, | |
| "eval_seen_f1_invalid": 0.9874002519949601, | |
| "eval_seen_macro_f1": 0.9901648914935912, | |
| "eval_seen_majority_baseline": 0.6400966183574879, | |
| "eval_seen_runtime": 0.3128, | |
| "eval_seen_samples_per_second": 21174.99, | |
| "eval_seen_steps_per_second": 166.229, | |
| "epoch": 1.2053033346725592, | |
| "step": 3000 | |
| }, | |
| { | |
| "eval_unseen_loss": 0.0712013989686966, | |
| "eval_unseen_accuracy": 0.9849033816425121, | |
| "eval_unseen_f1_valid": 0.9882103277528884, | |
| "eval_unseen_f1_invalid": 0.9790180444817457, | |
| "eval_unseen_macro_f1": 0.9836141861173171, | |
| "eval_unseen_majority_baseline": 0.6400966183574879, | |
| "eval_unseen_runtime": 0.3131, | |
| "eval_unseen_samples_per_second": 21157.43, | |
| "eval_unseen_steps_per_second": 166.091, | |
| "epoch": 1.2053033346725592, | |
| "step": 3000 | |
| }, | |
| { | |
| "loss": 0.027643091678619384, | |
| "grad_norm": 2.102973222732544, | |
| "learning_rate": 9.732914120508388e-05, | |
| "epoch": 1.2253917235837686, | |
| "step": 3050 | |
| }, | |
| { | |
| "loss": 0.024755525588989257, | |
| "grad_norm": 0.04891473799943924, | |
| "learning_rate": 9.722432268857117e-05, | |
| "epoch": 1.245480112494978, | |
| "step": 3100 | |
| }, | |
| { | |
| "loss": 0.026731245517730713, | |
| "grad_norm": 0.1450469195842743, | |
| "learning_rate": 9.711754541583158e-05, | |
| "epoch": 1.2655685014061873, | |
| "step": 3150 | |
| }, | |
| { | |
| "loss": 0.019302159547805786, | |
| "grad_norm": 0.19893020391464233, | |
| "learning_rate": 9.700881381574063e-05, | |
| "epoch": 1.2856568903173966, | |
| "step": 3200 | |
| }, | |
| { | |
| "loss": 0.02171895742416382, | |
| "grad_norm": 0.031684305518865585, | |
| "learning_rate": 9.689813239823489e-05, | |
| "epoch": 1.305745279228606, | |
| "step": 3250 | |
| }, | |
| { | |
| "loss": 0.018455970287322997, | |
| "grad_norm": 0.09408152848482132, | |
| "learning_rate": 9.678550575412486e-05, | |
| "epoch": 1.3258336681398153, | |
| "step": 3300 | |
| }, | |
| { | |
| "loss": 0.025521416664123536, | |
| "grad_norm": 0.09570422768592834, | |
| "learning_rate": 9.667093855490452e-05, | |
| "epoch": 1.3459220570510246, | |
| "step": 3350 | |
| }, | |
| { | |
| "loss": 0.02281453847885132, | |
| "grad_norm": 0.3635101914405823, | |
| "learning_rate": 9.655443555255764e-05, | |
| "epoch": 1.3660104459622338, | |
| "step": 3400 | |
| }, | |
| { | |
| "loss": 0.010848090648651124, | |
| "grad_norm": 0.2485629916191101, | |
| "learning_rate": 9.643600157936066e-05, | |
| "epoch": 1.386098834873443, | |
| "step": 3450 | |
| }, | |
| { | |
| "loss": 0.016650997400283814, | |
| "grad_norm": 0.9609498977661133, | |
| "learning_rate": 9.631564154768222e-05, | |
| "epoch": 1.4061872237846524, | |
| "step": 3500 | |
| }, | |
| { | |
| "eval_seen_loss": 0.017499525099992752, | |
| "eval_seen_accuracy": 0.9954710144927537, | |
| "eval_seen_f1_valid": 0.9964639321074964, | |
| "eval_seen_f1_invalid": 0.9937027707808564, | |
| "eval_seen_macro_f1": 0.9950833514441764, | |
| "eval_seen_majority_baseline": 0.6400966183574879, | |
| "eval_seen_runtime": 0.3159, | |
| "eval_seen_samples_per_second": 20968.449, | |
| "eval_seen_steps_per_second": 164.607, | |
| "epoch": 1.4061872237846524, | |
| "step": 3500 | |
| }, | |
| { | |
| "eval_unseen_loss": 0.028747964650392532, | |
| "eval_unseen_accuracy": 0.9919987922705314, | |
| "eval_unseen_f1_valid": 0.9937625044133225, | |
| "eval_unseen_f1_invalid": 0.9888444537992003, | |
| "eval_unseen_macro_f1": 0.9913034791062614, | |
| "eval_unseen_majority_baseline": 0.6400966183574879, | |
| "eval_unseen_runtime": 0.2935, | |
| "eval_unseen_samples_per_second": 22566.909, | |
| "eval_unseen_steps_per_second": 177.156, | |
| "epoch": 1.4061872237846524, | |
| "step": 3500 | |
| }, | |
| { | |
| "loss": 0.017104147672653197, | |
| "grad_norm": 0.3069566786289215, | |
| "learning_rate": 9.619336044977947e-05, | |
| "epoch": 1.4262756126958618, | |
| "step": 3550 | |
| }, | |
| { | |
| "loss": 0.013962976932525635, | |
| "grad_norm": 0.15175199508666992, | |
| "learning_rate": 9.606916335759091e-05, | |
| "epoch": 1.4463640016070711, | |
| "step": 3600 | |
| }, | |
| { | |
| "loss": 0.023543903827667235, | |
| "grad_norm": 0.09805657714605331, | |
| "learning_rate": 9.594305542252615e-05, | |
| "epoch": 1.4664523905182805, | |
| "step": 3650 | |
| }, | |
| { | |
| "loss": 0.01416290044784546, | |
| "grad_norm": 3.126929759979248, | |
| "learning_rate": 9.581504187525208e-05, | |
| "epoch": 1.4865407794294898, | |
| "step": 3700 | |
| }, | |
| { | |
| "loss": 0.01324806809425354, | |
| "grad_norm": 0.7419432401657104, | |
| "learning_rate": 9.568512802547605e-05, | |
| "epoch": 1.506629168340699, | |
| "step": 3750 | |
| }, | |
| { | |
| "loss": 0.019409667253494262, | |
| "grad_norm": 0.042299091815948486, | |
| "learning_rate": 9.555331926172559e-05, | |
| "epoch": 1.5267175572519083, | |
| "step": 3800 | |
| }, | |
| { | |
| "loss": 0.023891074657440184, | |
| "grad_norm": 0.44470810890197754, | |
| "learning_rate": 9.541962105112488e-05, | |
| "epoch": 1.5468059461631176, | |
| "step": 3850 | |
| }, | |
| { | |
| "loss": 0.011780786514282226, | |
| "grad_norm": 3.8765432834625244, | |
| "learning_rate": 9.528403893916802e-05, | |
| "epoch": 1.566894335074327, | |
| "step": 3900 | |
| }, | |
| { | |
| "loss": 0.016372852325439453, | |
| "grad_norm": 0.03911309689283371, | |
| "learning_rate": 9.514657854948898e-05, | |
| "epoch": 1.5869827239855363, | |
| "step": 3950 | |
| }, | |
| { | |
| "loss": 0.010347286462783814, | |
| "grad_norm": 1.1136096715927124, | |
| "learning_rate": 9.500724558362839e-05, | |
| "epoch": 1.6070711128967456, | |
| "step": 4000 | |
| }, | |
| { | |
| "eval_seen_loss": 0.016062559559941292, | |
| "eval_seen_accuracy": 0.9950181159420289, | |
| "eval_seen_f1_valid": 0.9961034360609281, | |
| "eval_seen_f1_invalid": 0.9930947897049591, | |
| "eval_seen_macro_f1": 0.9945991128829437, | |
| "eval_seen_majority_baseline": 0.6400966183574879, | |
| "eval_seen_runtime": 0.3221, | |
| "eval_seen_samples_per_second": 20567.513, | |
| "eval_seen_steps_per_second": 161.46, | |
| "epoch": 1.6070711128967456, | |
| "step": 4000 | |
| }, | |
| { | |
| "eval_unseen_loss": 0.07382287085056305, | |
| "eval_unseen_accuracy": 0.9827898550724637, | |
| "eval_unseen_f1_valid": 0.9864672364672364, | |
| "eval_unseen_f1_invalid": 0.97636815920398, | |
| "eval_unseen_macro_f1": 0.9814176978356082, | |
| "eval_unseen_majority_baseline": 0.6400966183574879, | |
| "eval_unseen_runtime": 0.3163, | |
| "eval_unseen_samples_per_second": 20943.475, | |
| "eval_unseen_steps_per_second": 164.411, | |
| "epoch": 1.6070711128967456, | |
| "step": 4000 | |
| }, | |
| { | |
| "loss": 0.03152747869491577, | |
| "grad_norm": 0.06820331513881683, | |
| "learning_rate": 9.486604582079704e-05, | |
| "epoch": 1.627159501807955, | |
| "step": 4050 | |
| }, | |
| { | |
| "loss": 0.015730949640274047, | |
| "grad_norm": 0.02219122089445591, | |
| "learning_rate": 9.472298511763613e-05, | |
| "epoch": 1.6472478907191643, | |
| "step": 4100 | |
| }, | |
| { | |
| "loss": 0.014006189107894897, | |
| "grad_norm": 4.819547176361084, | |
| "learning_rate": 9.457806940797439e-05, | |
| "epoch": 1.6673362796303737, | |
| "step": 4150 | |
| }, | |
| { | |
| "loss": 0.01701338529586792, | |
| "grad_norm": 0.02137128822505474, | |
| "learning_rate": 9.443130470258198e-05, | |
| "epoch": 1.687424668541583, | |
| "step": 4200 | |
| }, | |
| { | |
| "loss": 0.015609605312347412, | |
| "grad_norm": 0.14972175657749176, | |
| "learning_rate": 9.428269708892112e-05, | |
| "epoch": 1.7075130574527924, | |
| "step": 4250 | |
| }, | |
| { | |
| "loss": 0.009463921189308167, | |
| "grad_norm": 0.024293815717101097, | |
| "learning_rate": 9.413225273089364e-05, | |
| "epoch": 1.7276014463640017, | |
| "step": 4300 | |
| }, | |
| { | |
| "loss": 0.017783876657485962, | |
| "grad_norm": 1.126176118850708, | |
| "learning_rate": 9.397997786858526e-05, | |
| "epoch": 1.747689835275211, | |
| "step": 4350 | |
| }, | |
| { | |
| "loss": 0.017371171712875368, | |
| "grad_norm": 1.4426050186157227, | |
| "learning_rate": 9.382587881800687e-05, | |
| "epoch": 1.7677782241864204, | |
| "step": 4400 | |
| }, | |
| { | |
| "loss": 0.013080412149429321, | |
| "grad_norm": 0.010198249481618404, | |
| "learning_rate": 9.366996197083245e-05, | |
| "epoch": 1.7878666130976297, | |
| "step": 4450 | |
| }, | |
| { | |
| "loss": 0.010468505620956421, | |
| "grad_norm": 0.4493156671524048, | |
| "learning_rate": 9.351223379413398e-05, | |
| "epoch": 1.8079550020088389, | |
| "step": 4500 | |
| }, | |
| { | |
| "eval_seen_loss": 0.018062112852931023, | |
| "eval_seen_accuracy": 0.9950181159420289, | |
| "eval_seen_f1_valid": 0.9961071133655774, | |
| "eval_seen_f1_invalid": 0.9930832110668623, | |
| "eval_seen_macro_f1": 0.9945951622162199, | |
| "eval_seen_majority_baseline": 0.6400966183574879, | |
| "eval_seen_runtime": 0.3141, | |
| "eval_seen_samples_per_second": 21087.559, | |
| "eval_seen_steps_per_second": 165.542, | |
| "epoch": 1.8079550020088389, | |
| "step": 4500 | |
| }, | |
| { | |
| "eval_unseen_loss": 0.051321063190698624, | |
| "eval_unseen_accuracy": 0.9892814009661836, | |
| "eval_unseen_f1_valid": 0.9916026020106447, | |
| "eval_unseen_f1_invalid": 0.985186730648863, | |
| "eval_unseen_macro_f1": 0.9883946663297538, | |
| "eval_unseen_majority_baseline": 0.6400966183574879, | |
| "eval_unseen_runtime": 0.3119, | |
| "eval_unseen_samples_per_second": 21237.112, | |
| "eval_unseen_steps_per_second": 166.716, | |
| "epoch": 1.8079550020088389, | |
| "step": 4500 | |
| }, | |
| { | |
| "loss": 0.009371167421340943, | |
| "grad_norm": 0.23130910098552704, | |
| "learning_rate": 9.335270083011327e-05, | |
| "epoch": 1.8280433909200482, | |
| "step": 4550 | |
| }, | |
| { | |
| "loss": 0.00927388072013855, | |
| "grad_norm": 0.04569007828831673, | |
| "learning_rate": 9.319136969583053e-05, | |
| "epoch": 1.8481317798312575, | |
| "step": 4600 | |
| }, | |
| { | |
| "loss": 0.018707298040390015, | |
| "grad_norm": 1.7949227094650269, | |
| "learning_rate": 9.302824708292994e-05, | |
| "epoch": 1.8682201687424669, | |
| "step": 4650 | |
| }, | |
| { | |
| "loss": 0.010992642641067505, | |
| "grad_norm": 0.02038896456360817, | |
| "learning_rate": 9.286333975736206e-05, | |
| "epoch": 1.8883085576536762, | |
| "step": 4700 | |
| }, | |
| { | |
| "loss": 0.016763041019439696, | |
| "grad_norm": 36.40946578979492, | |
| "learning_rate": 9.269665455910328e-05, | |
| "epoch": 1.9083969465648853, | |
| "step": 4750 | |
| }, | |
| { | |
| "loss": 0.013855984210968017, | |
| "grad_norm": 0.3852629065513611, | |
| "learning_rate": 9.252819840187203e-05, | |
| "epoch": 1.9284853354760947, | |
| "step": 4800 | |
| }, | |
| { | |
| "loss": 0.008902734518051148, | |
| "grad_norm": 0.015681391581892967, | |
| "learning_rate": 9.235797827284202e-05, | |
| "epoch": 1.948573724387304, | |
| "step": 4850 | |
| }, | |
| { | |
| "loss": 0.008782572746276855, | |
| "grad_norm": 0.1879400908946991, | |
| "learning_rate": 9.218600123235248e-05, | |
| "epoch": 1.9686621132985134, | |
| "step": 4900 | |
| }, | |
| { | |
| "loss": 0.020532915592193602, | |
| "grad_norm": 0.6522228121757507, | |
| "learning_rate": 9.201227441361526e-05, | |
| "epoch": 1.9887505022097227, | |
| "step": 4950 | |
| }, | |
| { | |
| "loss": 0.019961978197097777, | |
| "grad_norm": 0.8586557507514954, | |
| "learning_rate": 9.183680502241903e-05, | |
| "epoch": 2.008838891120932, | |
| "step": 5000 | |
| }, | |
| { | |
| "eval_seen_loss": 0.021278277039527893, | |
| "eval_seen_accuracy": 0.9948671497584541, | |
| "eval_seen_f1_valid": 0.9959962317475272, | |
| "eval_seen_f1_invalid": 0.9928511354079058, | |
| "eval_seen_macro_f1": 0.9944236835777165, | |
| "eval_seen_majority_baseline": 0.6400966183574879, | |
| "eval_seen_runtime": 0.3206, | |
| "eval_seen_samples_per_second": 20661.243, | |
| "eval_seen_steps_per_second": 162.196, | |
| "epoch": 2.008838891120932, | |
| "step": 5000 | |
| }, | |
| { | |
| "eval_unseen_loss": 0.09243584424257278, | |
| "eval_unseen_accuracy": 0.9835446859903382, | |
| "eval_unseen_f1_valid": 0.9871930442956174, | |
| "eval_unseen_f1_invalid": 0.9769896559003589, | |
| "eval_unseen_macro_f1": 0.9820913500979882, | |
| "eval_unseen_majority_baseline": 0.6400966183574879, | |
| "eval_unseen_runtime": 0.3179, | |
| "eval_unseen_samples_per_second": 20837.542, | |
| "eval_unseen_steps_per_second": 163.58, | |
| "epoch": 2.008838891120932, | |
| "step": 5000 | |
| }, | |
| { | |
| "loss": 0.014057793617248536, | |
| "grad_norm": 0.0803026631474495, | |
| "learning_rate": 9.165960033683031e-05, | |
| "epoch": 2.0289272800321414, | |
| "step": 5050 | |
| }, | |
| { | |
| "loss": 0.01633061408996582, | |
| "grad_norm": 0.020075250416994095, | |
| "learning_rate": 9.148066770689166e-05, | |
| "epoch": 2.0490156689433507, | |
| "step": 5100 | |
| }, | |
| { | |
| "loss": 0.006894637346267701, | |
| "grad_norm": 0.011754917912185192, | |
| "learning_rate": 9.130001455431676e-05, | |
| "epoch": 2.06910405785456, | |
| "step": 5150 | |
| }, | |
| { | |
| "loss": 0.01216249942779541, | |
| "grad_norm": 0.0178280808031559, | |
| "learning_rate": 9.111764837218267e-05, | |
| "epoch": 2.0891924467657694, | |
| "step": 5200 | |
| }, | |
| { | |
| "loss": 0.013817080259323121, | |
| "grad_norm": 0.03707554191350937, | |
| "learning_rate": 9.093357672461894e-05, | |
| "epoch": 2.1092808356769788, | |
| "step": 5250 | |
| }, | |
| { | |
| "loss": 0.004771507978439331, | |
| "grad_norm": 0.30397188663482666, | |
| "learning_rate": 9.07478072464939e-05, | |
| "epoch": 2.129369224588188, | |
| "step": 5300 | |
| }, | |
| { | |
| "loss": 0.006007364988327026, | |
| "grad_norm": 0.031365204602479935, | |
| "learning_rate": 9.056034764309797e-05, | |
| "epoch": 2.1494576134993975, | |
| "step": 5350 | |
| }, | |
| { | |
| "loss": 0.00949288547039032, | |
| "grad_norm": 0.02746967040002346, | |
| "learning_rate": 9.037120568982412e-05, | |
| "epoch": 2.169546002410607, | |
| "step": 5400 | |
| }, | |
| { | |
| "loss": 0.01284904956817627, | |
| "grad_norm": 0.2411639392375946, | |
| "learning_rate": 9.018038923184529e-05, | |
| "epoch": 2.189634391321816, | |
| "step": 5450 | |
| }, | |
| { | |
| "loss": 0.00634078323841095, | |
| "grad_norm": 0.06414932012557983, | |
| "learning_rate": 8.998790618378901e-05, | |
| "epoch": 2.2097227802330255, | |
| "step": 5500 | |
| }, | |
| { | |
| "eval_seen_loss": 0.010500301606953144, | |
| "eval_seen_accuracy": 0.9977355072463768, | |
| "eval_seen_f1_valid": 0.9982321744254568, | |
| "eval_seen_f1_invalid": 0.9968507243334034, | |
| "eval_seen_macro_f1": 0.9975414493794301, | |
| "eval_seen_majority_baseline": 0.6400966183574879, | |
| "eval_seen_runtime": 0.3278, | |
| "eval_seen_samples_per_second": 20206.163, | |
| "eval_seen_steps_per_second": 158.623, | |
| "epoch": 2.2097227802330255, | |
| "step": 5500 | |
| }, | |
| { | |
| "eval_unseen_loss": 0.0262172669172287, | |
| "eval_unseen_accuracy": 0.9923007246376812, | |
| "eval_unseen_f1_valid": 0.9940007057993177, | |
| "eval_unseen_f1_invalid": 0.9892563724457551, | |
| "eval_unseen_macro_f1": 0.9916285391225363, | |
| "eval_unseen_majority_baseline": 0.6400966183574879, | |
| "eval_unseen_runtime": 0.297, | |
| "eval_unseen_samples_per_second": 22302.588, | |
| "eval_unseen_steps_per_second": 175.081, | |
| "epoch": 2.2097227802330255, | |
| "step": 5500 | |
| }, | |
| { | |
| "loss": 0.012844257354736328, | |
| "grad_norm": 0.03905527666211128, | |
| "learning_rate": 8.979376452940917e-05, | |
| "epoch": 2.229811169144235, | |
| "step": 5550 | |
| }, | |
| { | |
| "loss": 0.008379681706428528, | |
| "grad_norm": 0.00931452214717865, | |
| "learning_rate": 8.959797232125479e-05, | |
| "epoch": 2.2498995580554437, | |
| "step": 5600 | |
| }, | |
| { | |
| "loss": 0.009271252155303954, | |
| "grad_norm": 2.55387020111084, | |
| "learning_rate": 8.940053768033609e-05, | |
| "epoch": 2.269987946966653, | |
| "step": 5650 | |
| }, | |
| { | |
| "loss": 0.015088608264923095, | |
| "grad_norm": 0.033489350229501724, | |
| "learning_rate": 8.920146879578765e-05, | |
| "epoch": 2.2900763358778624, | |
| "step": 5700 | |
| }, | |
| { | |
| "loss": 0.007871510982513428, | |
| "grad_norm": 0.021451091393828392, | |
| "learning_rate": 8.900077392452864e-05, | |
| "epoch": 2.3101647247890718, | |
| "step": 5750 | |
| }, | |
| { | |
| "loss": 0.0116357684135437, | |
| "grad_norm": 1.7073649168014526, | |
| "learning_rate": 8.879846139092045e-05, | |
| "epoch": 2.330253113700281, | |
| "step": 5800 | |
| }, | |
| { | |
| "loss": 0.010076509714126587, | |
| "grad_norm": 0.07575485110282898, | |
| "learning_rate": 8.859453958642143e-05, | |
| "epoch": 2.3503415026114904, | |
| "step": 5850 | |
| }, | |
| { | |
| "loss": 0.008153905868530273, | |
| "grad_norm": 0.03403827175498009, | |
| "learning_rate": 8.838901696923871e-05, | |
| "epoch": 2.3704298915227, | |
| "step": 5900 | |
| }, | |
| { | |
| "loss": 0.002156134098768234, | |
| "grad_norm": 0.05620236694812775, | |
| "learning_rate": 8.818190206397749e-05, | |
| "epoch": 2.390518280433909, | |
| "step": 5950 | |
| }, | |
| { | |
| "loss": 0.013041321039199829, | |
| "grad_norm": 0.019352883100509644, | |
| "learning_rate": 8.797320346128739e-05, | |
| "epoch": 2.4106066693451185, | |
| "step": 6000 | |
| }, | |
| { | |
| "eval_seen_loss": 0.01673523522913456, | |
| "eval_seen_accuracy": 0.9953200483091788, | |
| "eval_seen_f1_valid": 0.9963395914511749, | |
| "eval_seen_f1_invalid": 0.993513287298598, | |
| "eval_seen_macro_f1": 0.9949264393748865, | |
| "eval_seen_majority_baseline": 0.6400966183574879, | |
| "eval_seen_runtime": 0.3192, | |
| "eval_seen_samples_per_second": 20749.181, | |
| "eval_seen_steps_per_second": 162.886, | |
| "epoch": 2.4106066693451185, | |
| "step": 6000 | |
| }, | |
| { | |
| "eval_unseen_loss": 0.06512533873319626, | |
| "eval_unseen_accuracy": 0.9859601449275363, | |
| "eval_unseen_f1_valid": 0.98898756660746, | |
| "eval_unseen_f1_invalid": 0.9806371018113679, | |
| "eval_unseen_macro_f1": 0.9848123342094139, | |
| "eval_unseen_majority_baseline": 0.6400966183574879, | |
| "eval_unseen_runtime": 0.3039, | |
| "eval_unseen_samples_per_second": 21795.481, | |
| "eval_unseen_steps_per_second": 171.1, | |
| "epoch": 2.4106066693451185, | |
| "step": 6000 | |
| }, | |
| { | |
| "loss": 0.011934045553207397, | |
| "grad_norm": 3.0569326877593994, | |
| "learning_rate": 8.776292981750618e-05, | |
| "epoch": 2.430695058256328, | |
| "step": 6050 | |
| }, | |
| { | |
| "loss": 0.009842355251312256, | |
| "grad_norm": 0.011145714670419693, | |
| "learning_rate": 8.755108985430068e-05, | |
| "epoch": 2.450783447167537, | |
| "step": 6100 | |
| }, | |
| { | |
| "loss": 0.006759999990463257, | |
| "grad_norm": 0.12077642232179642, | |
| "learning_rate": 8.73376923583051e-05, | |
| "epoch": 2.4708718360787465, | |
| "step": 6150 | |
| }, | |
| { | |
| "loss": 0.014839231967926025, | |
| "grad_norm": 0.04140232875943184, | |
| "learning_rate": 8.712274618075641e-05, | |
| "epoch": 2.490960224989956, | |
| "step": 6200 | |
| }, | |
| { | |
| "loss": 0.016083663702011107, | |
| "grad_norm": 0.03823714703321457, | |
| "learning_rate": 8.690626023712743e-05, | |
| "epoch": 2.511048613901165, | |
| "step": 6250 | |
| }, | |
| { | |
| "loss": 0.011055660247802735, | |
| "grad_norm": 6.6721906661987305, | |
| "learning_rate": 8.668824350675691e-05, | |
| "epoch": 2.5311370028123745, | |
| "step": 6300 | |
| }, | |
| { | |
| "loss": 0.01400442361831665, | |
| "grad_norm": 25.896717071533203, | |
| "learning_rate": 8.646870503247709e-05, | |
| "epoch": 2.551225391723584, | |
| "step": 6350 | |
| }, | |
| { | |
| "loss": 0.009680263996124268, | |
| "grad_norm": 0.026539063081145287, | |
| "learning_rate": 8.624765392023864e-05, | |
| "epoch": 2.571313780634793, | |
| "step": 6400 | |
| }, | |
| { | |
| "loss": 0.011566929817199707, | |
| "grad_norm": 0.14755235612392426, | |
| "learning_rate": 8.602509933873302e-05, | |
| "epoch": 2.5914021695460026, | |
| "step": 6450 | |
| }, | |
| { | |
| "loss": 0.008653899431228637, | |
| "grad_norm": 0.025059988722205162, | |
| "learning_rate": 8.580105051901206e-05, | |
| "epoch": 2.611490558457212, | |
| "step": 6500 | |
| }, | |
| { | |
| "eval_seen_loss": 0.014686978422105312, | |
| "eval_seen_accuracy": 0.996225845410628, | |
| "eval_seen_f1_valid": 0.9970515390965916, | |
| "eval_seen_f1_invalid": 0.9947578108618159, | |
| "eval_seen_macro_f1": 0.9959046749792038, | |
| "eval_seen_majority_baseline": 0.6400966183574879, | |
| "eval_seen_runtime": 0.3206, | |
| "eval_seen_samples_per_second": 20658.477, | |
| "eval_seen_steps_per_second": 162.174, | |
| "epoch": 2.611490558457212, | |
| "step": 6500 | |
| }, | |
| { | |
| "eval_unseen_loss": 0.040618833154439926, | |
| "eval_unseen_accuracy": 0.9883756038647343, | |
| "eval_unseen_f1_valid": 0.9909379781099212, | |
| "eval_unseen_f1_invalid": 0.983792885708272, | |
| "eval_unseen_macro_f1": 0.9873654319090965, | |
| "eval_unseen_majority_baseline": 0.6400966183574879, | |
| "eval_unseen_runtime": 0.3276, | |
| "eval_unseen_samples_per_second": 20220.354, | |
| "eval_unseen_steps_per_second": 158.735, | |
| "epoch": 2.611490558457212, | |
| "step": 6500 | |
| }, | |
| { | |
| "loss": 0.017121171951293944, | |
| "grad_norm": 1.6399306058883667, | |
| "learning_rate": 8.557551675410521e-05, | |
| "epoch": 2.6315789473684212, | |
| "step": 6550 | |
| }, | |
| { | |
| "loss": 0.01153093457221985, | |
| "grad_norm": 0.0197468101978302, | |
| "learning_rate": 8.534850739863402e-05, | |
| "epoch": 2.6516673362796306, | |
| "step": 6600 | |
| }, | |
| { | |
| "loss": 0.005534862875938415, | |
| "grad_norm": 0.011156822554767132, | |
| "learning_rate": 8.512003186842414e-05, | |
| "epoch": 2.67175572519084, | |
| "step": 6650 | |
| }, | |
| { | |
| "loss": 0.0065694618225097656, | |
| "grad_norm": 0.007382044102996588, | |
| "learning_rate": 8.489009964011476e-05, | |
| "epoch": 2.6918441141020493, | |
| "step": 6700 | |
| }, | |
| { | |
| "loss": 0.004922803938388825, | |
| "grad_norm": 0.023747533559799194, | |
| "learning_rate": 8.465872025076557e-05, | |
| "epoch": 2.7119325030132586, | |
| "step": 6750 | |
| }, | |
| { | |
| "loss": 0.004972059428691864, | |
| "grad_norm": 0.1991339474916458, | |
| "learning_rate": 8.442590329746114e-05, | |
| "epoch": 2.7320208919244675, | |
| "step": 6800 | |
| }, | |
| { | |
| "loss": 0.00948186993598938, | |
| "grad_norm": 0.018709462136030197, | |
| "learning_rate": 8.419165843691292e-05, | |
| "epoch": 2.752109280835677, | |
| "step": 6850 | |
| }, | |
| { | |
| "loss": 0.017984031438827514, | |
| "grad_norm": 0.04365852475166321, | |
| "learning_rate": 8.395599538505867e-05, | |
| "epoch": 2.772197669746886, | |
| "step": 6900 | |
| }, | |
| { | |
| "loss": 0.010866541862487793, | |
| "grad_norm": 3.3207244873046875, | |
| "learning_rate": 8.371892391665942e-05, | |
| "epoch": 2.7922860586580955, | |
| "step": 6950 | |
| }, | |
| { | |
| "loss": 0.004931770861148834, | |
| "grad_norm": 0.013545851223170757, | |
| "learning_rate": 8.348045386489412e-05, | |
| "epoch": 2.812374447569305, | |
| "step": 7000 | |
| }, | |
| { | |
| "eval_seen_loss": 0.016195246949791908, | |
| "eval_seen_accuracy": 0.9965277777777778, | |
| "eval_seen_f1_valid": 0.997288695037133, | |
| "eval_seen_f1_invalid": 0.9951731374606506, | |
| "eval_seen_macro_f1": 0.9962309162488918, | |
| "eval_seen_majority_baseline": 0.6400966183574879, | |
| "eval_seen_runtime": 0.3305, | |
| "eval_seen_samples_per_second": 20041.803, | |
| "eval_seen_steps_per_second": 157.333, | |
| "epoch": 2.812374447569305, | |
| "step": 7000 | |
| }, | |
| { | |
| "eval_unseen_loss": 0.034073229879140854, | |
| "eval_unseen_accuracy": 0.9930555555555556, | |
| "eval_unseen_f1_valid": 0.9945639328763886, | |
| "eval_unseen_f1_invalid": 0.9903886335144171, | |
| "eval_unseen_macro_f1": 0.9924762831954028, | |
| "eval_unseen_majority_baseline": 0.6400966183574879, | |
| "eval_unseen_runtime": 0.2931, | |
| "eval_unseen_samples_per_second": 22603.169, | |
| "eval_unseen_steps_per_second": 177.44, | |
| "epoch": 2.812374447569305, | |
| "step": 7000 | |
| }, | |
| { | |
| "loss": 0.016864250898361206, | |
| "grad_norm": 0.03497542813420296, | |
| "learning_rate": 8.32405951209517e-05, | |
| "epoch": 2.8324628364805142, | |
| "step": 7050 | |
| }, | |
| { | |
| "loss": 0.011661477088928222, | |
| "grad_norm": 0.1768326759338379, | |
| "learning_rate": 8.29993576336209e-05, | |
| "epoch": 2.8525512253917236, | |
| "step": 7100 | |
| }, | |
| { | |
| "loss": 0.00856854796409607, | |
| "grad_norm": 0.01989070326089859, | |
| "learning_rate": 8.275675140887748e-05, | |
| "epoch": 2.872639614302933, | |
| "step": 7150 | |
| }, | |
| { | |
| "loss": 0.005270370841026306, | |
| "grad_norm": 2.518010377883911, | |
| "learning_rate": 8.251278650946938e-05, | |
| "epoch": 2.8927280032141423, | |
| "step": 7200 | |
| }, | |
| { | |
| "loss": 0.01691861629486084, | |
| "grad_norm": 0.013693725690245628, | |
| "learning_rate": 8.226747305449918e-05, | |
| "epoch": 2.9128163921253516, | |
| "step": 7250 | |
| }, | |
| { | |
| "loss": 0.011077804565429688, | |
| "grad_norm": 0.05239178612828255, | |
| "learning_rate": 8.202082121900441e-05, | |
| "epoch": 2.932904781036561, | |
| "step": 7300 | |
| }, | |
| { | |
| "loss": 0.005902353525161743, | |
| "grad_norm": 0.011177760548889637, | |
| "learning_rate": 8.177284123353562e-05, | |
| "epoch": 2.9529931699477703, | |
| "step": 7350 | |
| }, | |
| { | |
| "loss": 0.005208334922790527, | |
| "grad_norm": 0.039729222655296326, | |
| "learning_rate": 8.152354338373189e-05, | |
| "epoch": 2.9730815588589796, | |
| "step": 7400 | |
| }, | |
| { | |
| "loss": 0.004365023374557495, | |
| "grad_norm": 0.007116931024938822, | |
| "learning_rate": 8.127293800989434e-05, | |
| "epoch": 2.993169947770189, | |
| "step": 7450 | |
| }, | |
| { | |
| "loss": 0.004765605926513672, | |
| "grad_norm": 0.04476737603545189, | |
| "learning_rate": 8.102103550655718e-05, | |
| "epoch": 3.0132583366813983, | |
| "step": 7500 | |
| }, | |
| { | |
| "eval_seen_loss": 0.01588328927755356, | |
| "eval_seen_accuracy": 0.9954710144927537, | |
| "eval_seen_f1_valid": 0.9964522232734153, | |
| "eval_seen_f1_invalid": 0.9937395659432388, | |
| "eval_seen_macro_f1": 0.995095894608327, | |
| "eval_seen_majority_baseline": 0.6400966183574879, | |
| "eval_seen_runtime": 0.3304, | |
| "eval_seen_samples_per_second": 20050.206, | |
| "eval_seen_steps_per_second": 157.399, | |
| "epoch": 3.0132583366813983, | |
| "step": 7500 | |
| }, | |
| { | |
| "eval_unseen_loss": 0.10731399804353714, | |
| "eval_unseen_accuracy": 0.9735809178743962, | |
| "eval_unseen_f1_valid": 0.9791144527986633, | |
| "eval_unseen_f1_invalid": 0.9640583281988088, | |
| "eval_unseen_macro_f1": 0.9715863904987361, | |
| "eval_unseen_majority_baseline": 0.6400966183574879, | |
| "eval_unseen_runtime": 0.3153, | |
| "eval_unseen_samples_per_second": 21009.724, | |
| "eval_unseen_steps_per_second": 164.931, | |
| "epoch": 3.0132583366813983, | |
| "step": 7500 | |
| }, | |
| { | |
| "loss": 0.002300529181957245, | |
| "grad_norm": 0.5621789693832397, | |
| "learning_rate": 8.076784632205647e-05, | |
| "epoch": 3.0333467255926077, | |
| "step": 7550 | |
| }, | |
| { | |
| "loss": 0.007070068120956421, | |
| "grad_norm": 0.015566053800284863, | |
| "learning_rate": 8.0513380958097e-05, | |
| "epoch": 3.053435114503817, | |
| "step": 7600 | |
| }, | |
| { | |
| "loss": 0.00422912985086441, | |
| "grad_norm": 6.171871185302734, | |
| "learning_rate": 8.025764996931638e-05, | |
| "epoch": 3.073523503415026, | |
| "step": 7650 | |
| }, | |
| { | |
| "loss": 0.011097090244293213, | |
| "grad_norm": 0.01741686835885048, | |
| "learning_rate": 8.000066396284756e-05, | |
| "epoch": 3.0936118923262352, | |
| "step": 7700 | |
| }, | |
| { | |
| "loss": 0.005830162763595581, | |
| "grad_norm": 0.019328523427248, | |
| "learning_rate": 7.974243359787865e-05, | |
| "epoch": 3.1137002812374446, | |
| "step": 7750 | |
| }, | |
| { | |
| "loss": 0.0016254797577857972, | |
| "grad_norm": 0.006262289825826883, | |
| "learning_rate": 7.948296958521093e-05, | |
| "epoch": 3.133788670148654, | |
| "step": 7800 | |
| }, | |
| { | |
| "loss": 0.005305635333061218, | |
| "grad_norm": 0.0055910260416567326, | |
| "learning_rate": 7.922228268681456e-05, | |
| "epoch": 3.1538770590598633, | |
| "step": 7850 | |
| }, | |
| { | |
| "loss": 0.004000791013240814, | |
| "grad_norm": 0.003951588179916143, | |
| "learning_rate": 7.896038371538213e-05, | |
| "epoch": 3.1739654479710726, | |
| "step": 7900 | |
| }, | |
| { | |
| "loss": 0.0049227488040924075, | |
| "grad_norm": 0.007216272410005331, | |
| "learning_rate": 7.869728353388026e-05, | |
| "epoch": 3.194053836882282, | |
| "step": 7950 | |
| }, | |
| { | |
| "loss": 0.00094679094851017, | |
| "grad_norm": 0.002421668032184243, | |
| "learning_rate": 7.843299305509902e-05, | |
| "epoch": 3.2141422257934913, | |
| "step": 8000 | |
| }, | |
| { | |
| "eval_seen_loss": 0.01580193266272545, | |
| "eval_seen_accuracy": 0.9966787439613527, | |
| "eval_seen_f1_valid": 0.9974044360547428, | |
| "eval_seen_f1_invalid": 0.9953897736797988, | |
| "eval_seen_macro_f1": 0.9963971048672708, | |
| "eval_seen_majority_baseline": 0.6400966183574879, | |
| "eval_seen_runtime": 0.3176, | |
| "eval_seen_samples_per_second": 20857.221, | |
| "eval_seen_steps_per_second": 163.734, | |
| "epoch": 3.2141422257934913, | |
| "step": 8000 | |
| }, | |
| { | |
| "eval_unseen_loss": 0.028369244188070297, | |
| "eval_unseen_accuracy": 0.9936594202898551, | |
| "eval_unseen_f1_valid": 0.9950460014154282, | |
| "eval_unseen_f1_invalid": 0.9911949685534591, | |
| "eval_unseen_macro_f1": 0.9931204849844437, | |
| "eval_unseen_majority_baseline": 0.6400966183574879, | |
| "eval_unseen_runtime": 0.3103, | |
| "eval_unseen_samples_per_second": 21345.059, | |
| "eval_unseen_steps_per_second": 167.564, | |
| "epoch": 3.2141422257934913, | |
| "step": 8000 | |
| }, | |
| { | |
| "loss": 0.010896263122558593, | |
| "grad_norm": 0.00519702909514308, | |
| "learning_rate": 7.816752324119924e-05, | |
| "epoch": 3.2342306147047006, | |
| "step": 8050 | |
| }, | |
| { | |
| "loss": 0.003296748399734497, | |
| "grad_norm": 0.0028257747180759907, | |
| "learning_rate": 7.790088510325788e-05, | |
| "epoch": 3.25431900361591, | |
| "step": 8100 | |
| }, | |
| { | |
| "loss": 0.006281962990760804, | |
| "grad_norm": 0.0049965763464570045, | |
| "learning_rate": 7.763308970081128e-05, | |
| "epoch": 3.2744073925271193, | |
| "step": 8150 | |
| }, | |
| { | |
| "loss": 0.0040089207887649535, | |
| "grad_norm": 0.004081875551491976, | |
| "learning_rate": 7.736414814139645e-05, | |
| "epoch": 3.2944957814383287, | |
| "step": 8200 | |
| }, | |
| { | |
| "loss": 0.00024588212370872496, | |
| "grad_norm": 0.003750850446522236, | |
| "learning_rate": 7.709407158009034e-05, | |
| "epoch": 3.314584170349538, | |
| "step": 8250 | |
| }, | |
| { | |
| "loss": 0.0010862263292074203, | |
| "grad_norm": 0.0021764510311186314, | |
| "learning_rate": 7.682287121904721e-05, | |
| "epoch": 3.3346725592607473, | |
| "step": 8300 | |
| }, | |
| { | |
| "loss": 0.005993441939353943, | |
| "grad_norm": 0.003460386535152793, | |
| "learning_rate": 7.655055830703391e-05, | |
| "epoch": 3.3547609481719567, | |
| "step": 8350 | |
| }, | |
| { | |
| "loss": 0.003086153566837311, | |
| "grad_norm": 0.021544523537158966, | |
| "learning_rate": 7.627714413896331e-05, | |
| "epoch": 3.374849337083166, | |
| "step": 8400 | |
| }, | |
| { | |
| "loss": 0.008029102087020875, | |
| "grad_norm": 0.008518628776073456, | |
| "learning_rate": 7.600264005542595e-05, | |
| "epoch": 3.3949377259943754, | |
| "step": 8450 | |
| }, | |
| { | |
| "loss": 0.0035008740425109862, | |
| "grad_norm": 0.0039153690449893475, | |
| "learning_rate": 7.572705744221945e-05, | |
| "epoch": 3.4150261149055847, | |
| "step": 8500 | |
| }, | |
| { | |
| "eval_seen_loss": 0.01266945619136095, | |
| "eval_seen_accuracy": 0.997433574879227, | |
| "eval_seen_f1_valid": 0.9979955193962976, | |
| "eval_seen_f1_invalid": 0.9964338158170758, | |
| "eval_seen_macro_f1": 0.9972146676066866, | |
| "eval_seen_majority_baseline": 0.6400966183574879, | |
| "eval_seen_runtime": 0.3186, | |
| "eval_seen_samples_per_second": 20790.062, | |
| "eval_seen_steps_per_second": 163.207, | |
| "epoch": 3.4150261149055847, | |
| "step": 8500 | |
| }, | |
| { | |
| "eval_unseen_loss": 0.027893278747797012, | |
| "eval_unseen_accuracy": 0.9921497584541062, | |
| "eval_unseen_f1_valid": 0.9938592347661785, | |
| "eval_unseen_f1_invalid": 0.9891213389121338, | |
| "eval_unseen_macro_f1": 0.9914902868391562, | |
| "eval_unseen_majority_baseline": 0.6400966183574879, | |
| "eval_unseen_runtime": 0.3113, | |
| "eval_unseen_samples_per_second": 21277.888, | |
| "eval_unseen_steps_per_second": 167.037, | |
| "epoch": 3.4150261149055847, | |
| "step": 8500 | |
| }, | |
| { | |
| "loss": 0.0038093182444572447, | |
| "grad_norm": 0.00725920032709837, | |
| "learning_rate": 7.545040772987641e-05, | |
| "epoch": 3.435114503816794, | |
| "step": 8550 | |
| }, | |
| { | |
| "loss": 0.00811230182647705, | |
| "grad_norm": 0.019070835784077644, | |
| "learning_rate": 7.517270239319026e-05, | |
| "epoch": 3.4552028927280034, | |
| "step": 8600 | |
| }, | |
| { | |
| "loss": 0.00710671603679657, | |
| "grad_norm": 0.01030392199754715, | |
| "learning_rate": 7.489395295073926e-05, | |
| "epoch": 3.4752912816392127, | |
| "step": 8650 | |
| }, | |
| { | |
| "loss": 0.004966625869274139, | |
| "grad_norm": 0.01758037507534027, | |
| "learning_rate": 7.46141709644088e-05, | |
| "epoch": 3.495379670550422, | |
| "step": 8700 | |
| }, | |
| { | |
| "loss": 0.008438785076141358, | |
| "grad_norm": 0.02527831308543682, | |
| "learning_rate": 7.433336803891177e-05, | |
| "epoch": 3.5154680594616314, | |
| "step": 8750 | |
| }, | |
| { | |
| "loss": 0.004293153584003448, | |
| "grad_norm": 0.28978201746940613, | |
| "learning_rate": 7.405155582130736e-05, | |
| "epoch": 3.5355564483728403, | |
| "step": 8800 | |
| }, | |
| { | |
| "loss": 0.008686498403549195, | |
| "grad_norm": 0.004737816285341978, | |
| "learning_rate": 7.376874600051778e-05, | |
| "epoch": 3.5556448372840497, | |
| "step": 8850 | |
| }, | |
| { | |
| "loss": 0.0028849306702613832, | |
| "grad_norm": 0.003080884926021099, | |
| "learning_rate": 7.348495030684358e-05, | |
| "epoch": 3.575733226195259, | |
| "step": 8900 | |
| }, | |
| { | |
| "loss": 0.00820321500301361, | |
| "grad_norm": 0.014155007898807526, | |
| "learning_rate": 7.320018051147699e-05, | |
| "epoch": 3.5958216151064684, | |
| "step": 8950 | |
| }, | |
| { | |
| "loss": 0.0075477021932601925, | |
| "grad_norm": 0.8712772727012634, | |
| "learning_rate": 7.291444842601382e-05, | |
| "epoch": 3.6159100040176777, | |
| "step": 9000 | |
| }, | |
| { | |
| "eval_seen_loss": 0.010590881109237671, | |
| "eval_seen_accuracy": 0.997433574879227, | |
| "eval_seen_f1_valid": 0.9979936268145875, | |
| "eval_seen_f1_invalid": 0.9964397905759161, | |
| "eval_seen_macro_f1": 0.9972167086952518, | |
| "eval_seen_majority_baseline": 0.6400966183574879, | |
| "eval_seen_runtime": 0.3229, | |
| "eval_seen_samples_per_second": 20512.361, | |
| "eval_seen_steps_per_second": 161.027, | |
| "epoch": 3.6159100040176777, | |
| "step": 9000 | |
| }, | |
| { | |
| "eval_unseen_loss": 0.039689332246780396, | |
| "eval_unseen_accuracy": 0.9910929951690821, | |
| "eval_unseen_f1_valid": 0.9930465527401295, | |
| "eval_unseen_f1_invalid": 0.9876128490447197, | |
| "eval_unseen_macro_f1": 0.9903297008924246, | |
| "eval_unseen_majority_baseline": 0.6400966183574879, | |
| "eval_unseen_runtime": 0.3101, | |
| "eval_unseen_samples_per_second": 21363.737, | |
| "eval_unseen_steps_per_second": 167.71, | |
| "epoch": 3.6159100040176777, | |
| "step": 9000 | |
| }, | |
| { | |
| "loss": 0.00436368465423584, | |
| "grad_norm": 0.0035482132807374, | |
| "learning_rate": 7.26277659019634e-05, | |
| "epoch": 3.635998392928887, | |
| "step": 9050 | |
| }, | |
| { | |
| "loss": 0.009257551431655884, | |
| "grad_norm": 0.026822760701179504, | |
| "learning_rate": 7.234014483025708e-05, | |
| "epoch": 3.6560867818400964, | |
| "step": 9100 | |
| }, | |
| { | |
| "loss": 0.004030225574970245, | |
| "grad_norm": 0.01450075302273035, | |
| "learning_rate": 7.205159714075501e-05, | |
| "epoch": 3.6761751707513057, | |
| "step": 9150 | |
| }, | |
| { | |
| "loss": 0.005230934023857116, | |
| "grad_norm": 0.034596361219882965, | |
| "learning_rate": 7.176213480175129e-05, | |
| "epoch": 3.696263559662515, | |
| "step": 9200 | |
| }, | |
| { | |
| "loss": 0.004835358262062073, | |
| "grad_norm": 0.014685052447021008, | |
| "learning_rate": 7.147176981947761e-05, | |
| "epoch": 3.7163519485737244, | |
| "step": 9250 | |
| }, | |
| { | |
| "loss": 0.0010214821994304656, | |
| "grad_norm": 0.01088032592087984, | |
| "learning_rate": 7.118051423760521e-05, | |
| "epoch": 3.7364403374849338, | |
| "step": 9300 | |
| }, | |
| { | |
| "loss": 0.0020134617388248444, | |
| "grad_norm": 0.0023934361524879932, | |
| "learning_rate": 7.088838013674537e-05, | |
| "epoch": 3.756528726396143, | |
| "step": 9350 | |
| }, | |
| { | |
| "loss": 0.011201596260070801, | |
| "grad_norm": 0.051524143666028976, | |
| "learning_rate": 7.059537963394827e-05, | |
| "epoch": 3.7766171153073524, | |
| "step": 9400 | |
| }, | |
| { | |
| "loss": 0.011317558288574218, | |
| "grad_norm": 0.04817855358123779, | |
| "learning_rate": 7.030152488220052e-05, | |
| "epoch": 3.796705504218562, | |
| "step": 9450 | |
| }, | |
| { | |
| "loss": 0.007253561615943909, | |
| "grad_norm": 0.05064212903380394, | |
| "learning_rate": 7.000682806992094e-05, | |
| "epoch": 3.816793893129771, | |
| "step": 9500 | |
| }, | |
| { | |
| "eval_seen_loss": 0.015345041640102863, | |
| "eval_seen_accuracy": 0.996225845410628, | |
| "eval_seen_f1_valid": 0.9970473603401441, | |
| "eval_seen_f1_invalid": 0.9947709684166491, | |
| "eval_seen_macro_f1": 0.9959091643783966, | |
| "eval_seen_majority_baseline": 0.6400966183574879, | |
| "eval_seen_runtime": 0.3207, | |
| "eval_seen_samples_per_second": 20651.644, | |
| "eval_seen_steps_per_second": 162.12, | |
| "epoch": 3.816793893129771, | |
| "step": 9500 | |
| }, | |
| { | |
| "eval_unseen_loss": 0.06220504641532898, | |
| "eval_unseen_accuracy": 0.9889794685990339, | |
| "eval_unseen_f1_valid": 0.9913640127765291, | |
| "eval_unseen_f1_invalid": 0.9847758081334724, | |
| "eval_unseen_macro_f1": 0.9880699104550008, | |
| "eval_unseen_majority_baseline": 0.6400966183574879, | |
| "eval_unseen_runtime": 0.3133, | |
| "eval_unseen_samples_per_second": 21143.712, | |
| "eval_unseen_steps_per_second": 165.983, | |
| "epoch": 3.816793893129771, | |
| "step": 9500 | |
| }, | |
| { | |
| "loss": 0.0028853157162666322, | |
| "grad_norm": 0.02075340412557125, | |
| "learning_rate": 6.97113014204551e-05, | |
| "epoch": 3.8368822820409805, | |
| "step": 9550 | |
| }, | |
| { | |
| "loss": 0.010675743818283082, | |
| "grad_norm": 0.03223203495144844, | |
| "learning_rate": 6.941495719156834e-05, | |
| "epoch": 3.8569706709521894, | |
| "step": 9600 | |
| }, | |
| { | |
| "loss": 0.005665901899337768, | |
| "grad_norm": 0.0044933464378118515, | |
| "learning_rate": 6.911780767493729e-05, | |
| "epoch": 3.8770590598633987, | |
| "step": 9650 | |
| }, | |
| { | |
| "loss": 0.007787343263626099, | |
| "grad_norm": 9.683483123779297, | |
| "learning_rate": 6.881986519564006e-05, | |
| "epoch": 3.897147448774608, | |
| "step": 9700 | |
| }, | |
| { | |
| "loss": 0.009898404479026795, | |
| "grad_norm": 5.278289318084717, | |
| "learning_rate": 6.852114211164502e-05, | |
| "epoch": 3.9172358376858174, | |
| "step": 9750 | |
| }, | |
| { | |
| "loss": 0.0028400224447250365, | |
| "grad_norm": 0.006490530911833048, | |
| "learning_rate": 6.822165081329826e-05, | |
| "epoch": 3.9373242265970267, | |
| "step": 9800 | |
| }, | |
| { | |
| "loss": 0.002898951768875122, | |
| "grad_norm": 2.960984230041504, | |
| "learning_rate": 6.79214037228096e-05, | |
| "epoch": 3.957412615508236, | |
| "step": 9850 | |
| }, | |
| { | |
| "loss": 0.00907094955444336, | |
| "grad_norm": 0.04198857396841049, | |
| "learning_rate": 6.762041329373739e-05, | |
| "epoch": 3.9775010044194454, | |
| "step": 9900 | |
| }, | |
| { | |
| "loss": 0.006905393600463867, | |
| "grad_norm": 0.14619038999080658, | |
| "learning_rate": 6.731869201047192e-05, | |
| "epoch": 3.9975893933306548, | |
| "step": 9950 | |
| }, | |
| { | |
| "loss": 0.009627650380134583, | |
| "grad_norm": 0.016034724190831184, | |
| "learning_rate": 6.701625238771774e-05, | |
| "epoch": 4.017677782241864, | |
| "step": 10000 | |
| }, | |
| { | |
| "eval_seen_loss": 0.011894118040800095, | |
| "eval_seen_accuracy": 0.9969806763285024, | |
| "eval_seen_f1_valid": 0.9976403964134026, | |
| "eval_seen_f1_invalid": 0.9958088851634533, | |
| "eval_seen_macro_f1": 0.996724640788428, | |
| "eval_seen_majority_baseline": 0.6400966183574879, | |
| "eval_seen_runtime": 0.329, | |
| "eval_seen_samples_per_second": 20131.157, | |
| "eval_seen_steps_per_second": 158.034, | |
| "epoch": 4.017677782241864, | |
| "step": 10000 | |
| }, | |
| { | |
| "eval_unseen_loss": 0.03878156840801239, | |
| "eval_unseen_accuracy": 0.9882246376811594, | |
| "eval_unseen_f1_valid": 0.9907866761162296, | |
| "eval_unseen_f1_invalid": 0.983688833124216, | |
| "eval_unseen_macro_f1": 0.9872377546202228, | |
| "eval_unseen_majority_baseline": 0.6400966183574879, | |
| "eval_unseen_runtime": 0.3023, | |
| "eval_unseen_samples_per_second": 21913.894, | |
| "eval_unseen_steps_per_second": 172.029, | |
| "epoch": 4.017677782241864, | |
| "step": 10000 | |
| }, | |
| { | |
| "loss": 0.005427371263504028, | |
| "grad_norm": 0.005436044652014971, | |
| "learning_rate": 6.67131069699743e-05, | |
| "epoch": 4.0377661711530735, | |
| "step": 10050 | |
| }, | |
| { | |
| "loss": 0.0034640106558799745, | |
| "grad_norm": 0.06325726956129074, | |
| "learning_rate": 6.640926833101597e-05, | |
| "epoch": 4.057854560064283, | |
| "step": 10100 | |
| }, | |
| { | |
| "loss": 0.0027718636393547057, | |
| "grad_norm": 0.0038235979154706, | |
| "learning_rate": 6.610474907337023e-05, | |
| "epoch": 4.077942948975492, | |
| "step": 10150 | |
| }, | |
| { | |
| "loss": 0.0030018627643585206, | |
| "grad_norm": 0.005502292420715094, | |
| "learning_rate": 6.579956182779509e-05, | |
| "epoch": 4.0980313378867015, | |
| "step": 10200 | |
| }, | |
| { | |
| "loss": 0.006214578151702881, | |
| "grad_norm": 0.006388835608959198, | |
| "learning_rate": 6.549371925275516e-05, | |
| "epoch": 4.118119726797911, | |
| "step": 10250 | |
| }, | |
| { | |
| "loss": 0.004299657046794891, | |
| "grad_norm": 0.02509908750653267, | |
| "learning_rate": 6.518723403389662e-05, | |
| "epoch": 4.13820811570912, | |
| "step": 10300 | |
| }, | |
| { | |
| "loss": 0.0021544244885444643, | |
| "grad_norm": 0.004356733988970518, | |
| "learning_rate": 6.488011888352102e-05, | |
| "epoch": 4.1582965046203295, | |
| "step": 10350 | |
| }, | |
| { | |
| "loss": 0.002441017180681229, | |
| "grad_norm": 0.012465689331293106, | |
| "learning_rate": 6.457238654005805e-05, | |
| "epoch": 4.178384893531539, | |
| "step": 10400 | |
| }, | |
| { | |
| "loss": 0.005048474669456482, | |
| "grad_norm": 0.0057596489787101746, | |
| "learning_rate": 6.42640497675371e-05, | |
| "epoch": 4.198473282442748, | |
| "step": 10450 | |
| }, | |
| { | |
| "loss": 0.0016454234719276428, | |
| "grad_norm": 0.752906322479248, | |
| "learning_rate": 6.395512135505794e-05, | |
| "epoch": 4.2185616713539575, | |
| "step": 10500 | |
| }, | |
| { | |
| "eval_seen_loss": 0.021507009863853455, | |
| "eval_seen_accuracy": 0.9957729468599034, | |
| "eval_seen_f1_valid": 0.9967004477963705, | |
| "eval_seen_f1_invalid": 0.994120117597648, | |
| "eval_seen_macro_f1": 0.9954102826970093, | |
| "eval_seen_majority_baseline": 0.6400966183574879, | |
| "eval_seen_runtime": 0.315, | |
| "eval_seen_samples_per_second": 21030.908, | |
| "eval_seen_steps_per_second": 165.098, | |
| "epoch": 4.2185616713539575, | |
| "step": 10500 | |
| }, | |
| { | |
| "eval_unseen_loss": 0.04845276474952698, | |
| "eval_unseen_accuracy": 0.9897342995169082, | |
| "eval_unseen_f1_valid": 0.9919488515273502, | |
| "eval_unseen_f1_invalid": 0.9858392336526446, | |
| "eval_unseen_macro_f1": 0.9888940425899975, | |
| "eval_unseen_majority_baseline": 0.6400966183574879, | |
| "eval_unseen_runtime": 0.31, | |
| "eval_unseen_samples_per_second": 21366.218, | |
| "eval_unseen_steps_per_second": 167.73, | |
| "epoch": 4.2185616713539575, | |
| "step": 10500 | |
| }, | |
| { | |
| "loss": 0.00538996934890747, | |
| "grad_norm": 0.0065927463583648205, | |
| "learning_rate": 6.364561411626013e-05, | |
| "epoch": 4.238650060265167, | |
| "step": 10550 | |
| }, | |
| { | |
| "loss": 0.0015137888491153716, | |
| "grad_norm": 0.12535056471824646, | |
| "learning_rate": 6.333554088879173e-05, | |
| "epoch": 4.258738449176376, | |
| "step": 10600 | |
| }, | |
| { | |
| "loss": 0.005469639897346497, | |
| "grad_norm": 0.1713482290506363, | |
| "learning_rate": 6.302491453377655e-05, | |
| "epoch": 4.278826838087586, | |
| "step": 10650 | |
| }, | |
| { | |
| "loss": 0.0035777607560157775, | |
| "grad_norm": 0.0622786246240139, | |
| "learning_rate": 6.271374793528103e-05, | |
| "epoch": 4.298915226998795, | |
| "step": 10700 | |
| }, | |
| { | |
| "loss": 0.0011316427588462829, | |
| "grad_norm": 0.0019172088941559196, | |
| "learning_rate": 6.240205399977955e-05, | |
| "epoch": 4.319003615910004, | |
| "step": 10750 | |
| }, | |
| { | |
| "loss": 0.0026168256998062136, | |
| "grad_norm": 0.005300440359860659, | |
| "learning_rate": 6.208984565561921e-05, | |
| "epoch": 4.339092004821214, | |
| "step": 10800 | |
| }, | |
| { | |
| "loss": 0.006189553141593933, | |
| "grad_norm": 0.005188933108001947, | |
| "learning_rate": 6.17771358524837e-05, | |
| "epoch": 4.359180393732423, | |
| "step": 10850 | |
| }, | |
| { | |
| "loss": 0.008901360034942627, | |
| "grad_norm": 0.0037269098684191704, | |
| "learning_rate": 6.146393756085595e-05, | |
| "epoch": 4.379268782643632, | |
| "step": 10900 | |
| }, | |
| { | |
| "loss": 0.0011978115141391755, | |
| "grad_norm": 0.004762765485793352, | |
| "learning_rate": 6.115026377148037e-05, | |
| "epoch": 4.399357171554842, | |
| "step": 10950 | |
| }, | |
| { | |
| "loss": 0.0011883687973022461, | |
| "grad_norm": 0.0023202828597277403, | |
| "learning_rate": 6.083612749482388e-05, | |
| "epoch": 4.419445560466051, | |
| "step": 11000 | |
| }, | |
| { | |
| "eval_seen_loss": 0.008558264002203941, | |
| "eval_seen_accuracy": 0.9980374396135265, | |
| "eval_seen_f1_valid": 0.9984664385985609, | |
| "eval_seen_f1_invalid": 0.9972752043596731, | |
| "eval_seen_macro_f1": 0.997870821479117, | |
| "eval_seen_majority_baseline": 0.6400966183574879, | |
| "eval_seen_runtime": 0.3239, | |
| "eval_seen_samples_per_second": 20450.306, | |
| "eval_seen_steps_per_second": 160.54, | |
| "epoch": 4.419445560466051, | |
| "step": 11000 | |
| }, | |
| { | |
| "eval_unseen_loss": 0.0422622486948967, | |
| "eval_unseen_accuracy": 0.9889794685990339, | |
| "eval_unseen_f1_valid": 0.9913353115727003, | |
| "eval_unseen_f1_invalid": 0.9848641924113622, | |
| "eval_unseen_macro_f1": 0.9880997519920313, | |
| "eval_unseen_majority_baseline": 0.6400966183574879, | |
| "eval_unseen_runtime": 0.2973, | |
| "eval_unseen_samples_per_second": 22280.875, | |
| "eval_unseen_steps_per_second": 174.91, | |
| "epoch": 4.419445560466051, | |
| "step": 11000 | |
| }, | |
| { | |
| "loss": 0.003962970674037934, | |
| "grad_norm": 0.006651753559708595, | |
| "learning_rate": 6.052154176053626e-05, | |
| "epoch": 4.43953394937726, | |
| "step": 11050 | |
| }, | |
| { | |
| "loss": 0.000864512175321579, | |
| "grad_norm": 0.009494757279753685, | |
| "learning_rate": 6.0206519616909876e-05, | |
| "epoch": 4.45962233828847, | |
| "step": 11100 | |
| }, | |
| { | |
| "loss": 0.00789304792881012, | |
| "grad_norm": 0.003297999268397689, | |
| "learning_rate": 5.9891074130338207e-05, | |
| "epoch": 4.479710727199679, | |
| "step": 11150 | |
| }, | |
| { | |
| "loss": 0.0034743845462799072, | |
| "grad_norm": 0.009166165255010128, | |
| "learning_rate": 5.957521838477414e-05, | |
| "epoch": 4.4997991161108875, | |
| "step": 11200 | |
| }, | |
| { | |
| "loss": 0.004978830218315125, | |
| "grad_norm": 0.0029759351164102554, | |
| "learning_rate": 5.9258965481187126e-05, | |
| "epoch": 4.519887505022098, | |
| "step": 11250 | |
| }, | |
| { | |
| "loss": 0.0007813534885644913, | |
| "grad_norm": 0.023890171200037003, | |
| "learning_rate": 5.8942328537019766e-05, | |
| "epoch": 4.539975893933306, | |
| "step": 11300 | |
| }, | |
| { | |
| "loss": 0.0031626516580581664, | |
| "grad_norm": 0.0044487579725682735, | |
| "learning_rate": 5.8625320685643834e-05, | |
| "epoch": 4.5600642828445155, | |
| "step": 11350 | |
| }, | |
| { | |
| "loss": 0.0036859130859375, | |
| "grad_norm": 0.022548481822013855, | |
| "learning_rate": 5.83079550758155e-05, | |
| "epoch": 4.580152671755725, | |
| "step": 11400 | |
| }, | |
| { | |
| "loss": 0.0005728846788406372, | |
| "grad_norm": 0.0019822390750050545, | |
| "learning_rate": 5.799024487112986e-05, | |
| "epoch": 4.600241060666934, | |
| "step": 11450 | |
| }, | |
| { | |
| "loss": 0.005244595408439637, | |
| "grad_norm": 0.0025443369522690773, | |
| "learning_rate": 5.767220324947509e-05, | |
| "epoch": 4.6203294495781435, | |
| "step": 11500 | |
| }, | |
| { | |
| "eval_seen_loss": 0.007967733778059483, | |
| "eval_seen_accuracy": 0.9981884057971014, | |
| "eval_seen_f1_valid": 0.9985852393303466, | |
| "eval_seen_f1_invalid": 0.9974821653378095, | |
| "eval_seen_macro_f1": 0.9980337023340781, | |
| "eval_seen_majority_baseline": 0.6400966183574879, | |
| "eval_seen_runtime": 0.3207, | |
| "eval_seen_samples_per_second": 20651.598, | |
| "eval_seen_steps_per_second": 162.12, | |
| "epoch": 4.6203294495781435, | |
| "step": 11500 | |
| }, | |
| { | |
| "eval_unseen_loss": 0.02163851074874401, | |
| "eval_unseen_accuracy": 0.9939613526570048, | |
| "eval_unseen_f1_valid": 0.9952852428099952, | |
| "eval_unseen_f1_invalid": 0.9916036943744752, | |
| "eval_unseen_macro_f1": 0.9934444685922352, | |
| "eval_unseen_majority_baseline": 0.6400966183574879, | |
| "eval_unseen_runtime": 0.2963, | |
| "eval_unseen_samples_per_second": 22358.064, | |
| "eval_unseen_steps_per_second": 175.516, | |
| "epoch": 4.6203294495781435, | |
| "step": 11500 | |
| }, | |
| { | |
| "loss": 0.0024283653497695922, | |
| "grad_norm": 0.002546750009059906, | |
| "learning_rate": 5.735384340248569e-05, | |
| "epoch": 4.640417838489353, | |
| "step": 11550 | |
| }, | |
| { | |
| "loss": 0.007456202507019043, | |
| "grad_norm": 0.0035354087594896555, | |
| "learning_rate": 5.703517853499553e-05, | |
| "epoch": 4.660506227400562, | |
| "step": 11600 | |
| }, | |
| { | |
| "loss": 0.0023691913485527037, | |
| "grad_norm": 4.495802402496338, | |
| "learning_rate": 5.671622186448989e-05, | |
| "epoch": 4.6805946163117715, | |
| "step": 11650 | |
| }, | |
| { | |
| "loss": 0.002830646634101868, | |
| "grad_norm": 0.0077832662500441074, | |
| "learning_rate": 5.639698662055751e-05, | |
| "epoch": 4.700683005222981, | |
| "step": 11700 | |
| }, | |
| { | |
| "loss": 0.0030017268657684328, | |
| "grad_norm": 0.018308039754629135, | |
| "learning_rate": 5.607748604434161e-05, | |
| "epoch": 4.72077139413419, | |
| "step": 11750 | |
| }, | |
| { | |
| "loss": 0.00012694787234067916, | |
| "grad_norm": 0.0019742785952985287, | |
| "learning_rate": 5.575773338799083e-05, | |
| "epoch": 4.7408597830454, | |
| "step": 11800 | |
| }, | |
| { | |
| "loss": 0.003408160209655762, | |
| "grad_norm": 0.0017532280180603266, | |
| "learning_rate": 5.5437741914109485e-05, | |
| "epoch": 4.760948171956609, | |
| "step": 11850 | |
| }, | |
| { | |
| "loss": 0.0006748394668102264, | |
| "grad_norm": 0.009566946886479855, | |
| "learning_rate": 5.511752489520753e-05, | |
| "epoch": 4.781036560867818, | |
| "step": 11900 | |
| }, | |
| { | |
| "loss": 0.0019586144387722017, | |
| "grad_norm": 0.003580181859433651, | |
| "learning_rate": 5.4797095613149983e-05, | |
| "epoch": 4.801124949779028, | |
| "step": 11950 | |
| }, | |
| { | |
| "loss": 0.006813893914222717, | |
| "grad_norm": 0.016823643818497658, | |
| "learning_rate": 5.4476467358606044e-05, | |
| "epoch": 4.821213338690237, | |
| "step": 12000 | |
| }, | |
| { | |
| "eval_seen_loss": 0.011064874939620495, | |
| "eval_seen_accuracy": 0.9972826086956522, | |
| "eval_seen_f1_valid": 0.99787785899552, | |
| "eval_seen_f1_invalid": 0.9962232480067142, | |
| "eval_seen_macro_f1": 0.9970505535011172, | |
| "eval_seen_majority_baseline": 0.6400966183574879, | |
| "eval_seen_runtime": 0.3175, | |
| "eval_seen_samples_per_second": 20860.995, | |
| "eval_seen_steps_per_second": 163.764, | |
| "epoch": 4.821213338690237, | |
| "step": 12000 | |
| }, | |
| { | |
| "eval_unseen_loss": 0.051994677633047104, | |
| "eval_unseen_accuracy": 0.9859601449275363, | |
| "eval_unseen_f1_valid": 0.9889953851615193, | |
| "eval_unseen_f1_invalid": 0.9806128830519075, | |
| "eval_unseen_macro_f1": 0.9848041341067134, | |
| "eval_unseen_majority_baseline": 0.6400966183574879, | |
| "eval_unseen_runtime": 0.3132, | |
| "eval_unseen_samples_per_second": 21152.179, | |
| "eval_unseen_steps_per_second": 166.05, | |
| "epoch": 4.821213338690237, | |
| "step": 12000 | |
| }, | |
| { | |
| "loss": 0.0032321390509605407, | |
| "grad_norm": 0.00454537570476532, | |
| "learning_rate": 5.415565343049785e-05, | |
| "epoch": 4.841301727601446, | |
| "step": 12050 | |
| }, | |
| { | |
| "loss": 0.0032006219029426576, | |
| "grad_norm": 6.071142673492432, | |
| "learning_rate": 5.383466713544886e-05, | |
| "epoch": 4.861390116512656, | |
| "step": 12100 | |
| }, | |
| { | |
| "loss": 0.00025400251150131225, | |
| "grad_norm": 0.0011727007804438472, | |
| "learning_rate": 5.351352178723186e-05, | |
| "epoch": 4.881478505423865, | |
| "step": 12150 | |
| }, | |
| { | |
| "loss": 0.002920109033584595, | |
| "grad_norm": 0.01371962670236826, | |
| "learning_rate": 5.319223070621688e-05, | |
| "epoch": 4.901566894335074, | |
| "step": 12200 | |
| }, | |
| { | |
| "loss": 0.00021828394383192063, | |
| "grad_norm": 0.0007112867897376418, | |
| "learning_rate": 5.287080721881854e-05, | |
| "epoch": 4.921655283246284, | |
| "step": 12250 | |
| }, | |
| { | |
| "loss": 0.0014558228850364684, | |
| "grad_norm": 0.001511621754616499, | |
| "learning_rate": 5.254926465694341e-05, | |
| "epoch": 4.941743672157493, | |
| "step": 12300 | |
| }, | |
| { | |
| "loss": 0.005796372890472412, | |
| "grad_norm": 0.20507988333702087, | |
| "learning_rate": 5.222761635743697e-05, | |
| "epoch": 4.961832061068702, | |
| "step": 12350 | |
| }, | |
| { | |
| "loss": 0.005083301663398742, | |
| "grad_norm": 0.0018521308666095138, | |
| "learning_rate": 5.190587566153049e-05, | |
| "epoch": 4.981920449979912, | |
| "step": 12400 | |
| }, | |
| { | |
| "loss": 0.0006556917726993561, | |
| "grad_norm": 0.0016021252376958728, | |
| "learning_rate": 5.15840559142876e-05, | |
| "epoch": 5.002008838891121, | |
| "step": 12450 | |
| }, | |
| { | |
| "loss": 0.0015148460865020753, | |
| "grad_norm": 0.0033229379914700985, | |
| "learning_rate": 5.12621704640508e-05, | |
| "epoch": 5.02209722780233, | |
| "step": 12500 | |
| }, | |
| { | |
| "eval_seen_loss": 0.016905121505260468, | |
| "eval_seen_accuracy": 0.996225845410628, | |
| "eval_seen_f1_valid": 0.997052929388188, | |
| "eval_seen_f1_invalid": 0.994753410283316, | |
| "eval_seen_macro_f1": 0.995903169835752, | |
| "eval_seen_majority_baseline": 0.6400966183574879, | |
| "eval_seen_runtime": 0.3193, | |
| "eval_seen_samples_per_second": 20747.708, | |
| "eval_seen_steps_per_second": 162.875, | |
| "epoch": 5.02209722780233, | |
| "step": 12500 | |
| }, | |
| { | |
| "eval_unseen_loss": 0.08490641415119171, | |
| "eval_unseen_accuracy": 0.9846014492753623, | |
| "eval_unseen_f1_valid": 0.9879232772910254, | |
| "eval_unseen_f1_invalid": 0.9787588504789672, | |
| "eval_unseen_macro_f1": 0.9833410638849962, | |
| "eval_unseen_majority_baseline": 0.6400966183574879, | |
| "eval_unseen_runtime": 0.3059, | |
| "eval_unseen_samples_per_second": 21657.606, | |
| "eval_unseen_steps_per_second": 170.017, | |
| "epoch": 5.02209722780233, | |
| "step": 12500 | |
| }, | |
| { | |
| "loss": 0.00185398668050766, | |
| "grad_norm": 0.0010378584265708923, | |
| "learning_rate": 5.09402326618878e-05, | |
| "epoch": 5.04218561671354, | |
| "step": 12550 | |
| }, | |
| { | |
| "loss": 0.0015885192155838013, | |
| "grad_norm": 0.0015575550496578217, | |
| "learning_rate": 5.0618255861037776e-05, | |
| "epoch": 5.062274005624749, | |
| "step": 12600 | |
| }, | |
| { | |
| "loss": 0.00361468642950058, | |
| "grad_norm": 0.001530500827357173, | |
| "learning_rate": 5.029625341635743e-05, | |
| "epoch": 5.082362394535958, | |
| "step": 12650 | |
| }, | |
| { | |
| "loss": 7.036324590444565e-05, | |
| "grad_norm": 0.0011731426930055022, | |
| "learning_rate": 4.9974238683767154e-05, | |
| "epoch": 5.102450783447168, | |
| "step": 12700 | |
| }, | |
| { | |
| "loss": 0.00022802915424108505, | |
| "grad_norm": 0.0010616343934088945, | |
| "learning_rate": 4.9652225019696986e-05, | |
| "epoch": 5.122539172358377, | |
| "step": 12750 | |
| }, | |
| { | |
| "loss": 0.002062407433986664, | |
| "grad_norm": 0.0012495917035266757, | |
| "learning_rate": 4.9330225780532654e-05, | |
| "epoch": 5.142627561269586, | |
| "step": 12800 | |
| }, | |
| { | |
| "loss": 0.0007111681997776032, | |
| "grad_norm": 0.09994599968194962, | |
| "learning_rate": 4.9008254322061595e-05, | |
| "epoch": 5.162715950180796, | |
| "step": 12850 | |
| }, | |
| { | |
| "loss": 0.0007095547020435334, | |
| "grad_norm": 0.0009567381348460913, | |
| "learning_rate": 4.868632399891892e-05, | |
| "epoch": 5.182804339092005, | |
| "step": 12900 | |
| }, | |
| { | |
| "loss": 6.402432918548585e-05, | |
| "grad_norm": 0.0007548440480604768, | |
| "learning_rate": 4.83644481640336e-05, | |
| "epoch": 5.2028927280032145, | |
| "step": 12950 | |
| }, | |
| { | |
| "loss": 0.0011706628650426864, | |
| "grad_norm": 0.0007474229787476361, | |
| "learning_rate": 4.804264016807448e-05, | |
| "epoch": 5.222981116914424, | |
| "step": 13000 | |
| }, | |
| { | |
| "eval_seen_loss": 0.007674613501876593, | |
| "eval_seen_accuracy": 0.9981884057971014, | |
| "eval_seen_f1_valid": 0.9985845718329796, | |
| "eval_seen_f1_invalid": 0.9974842767295596, | |
| "eval_seen_macro_f1": 0.9980344242812695, | |
| "eval_seen_majority_baseline": 0.6400966183574879, | |
| "eval_seen_runtime": 0.3285, | |
| "eval_seen_samples_per_second": 20167.265, | |
| "eval_seen_steps_per_second": 158.318, | |
| "epoch": 5.222981116914424, | |
| "step": 13000 | |
| }, | |
| { | |
| "eval_unseen_loss": 0.06615690886974335, | |
| "eval_unseen_accuracy": 0.9891304347826086, | |
| "eval_unseen_f1_valid": 0.9914953933380581, | |
| "eval_unseen_f1_invalid": 0.9849435382685069, | |
| "eval_unseen_macro_f1": 0.9882194658032826, | |
| "eval_unseen_majority_baseline": 0.6400966183574879, | |
| "eval_unseen_runtime": 0.3195, | |
| "eval_unseen_samples_per_second": 20734.098, | |
| "eval_unseen_steps_per_second": 162.768, | |
| "epoch": 5.222981116914424, | |
| "step": 13000 | |
| }, | |
| { | |
| "loss": 0.0001120208203792572, | |
| "grad_norm": 0.0006617383914999664, | |
| "learning_rate": 4.7720913358896704e-05, | |
| "epoch": 5.243069505825633, | |
| "step": 13050 | |
| }, | |
| { | |
| "loss": 0.0048398998379707335, | |
| "grad_norm": 0.39095479249954224, | |
| "learning_rate": 4.739928108098789e-05, | |
| "epoch": 5.2631578947368425, | |
| "step": 13100 | |
| }, | |
| { | |
| "loss": 0.0014353193342685699, | |
| "grad_norm": 0.011521922424435616, | |
| "learning_rate": 4.707775667491475e-05, | |
| "epoch": 5.283246283648052, | |
| "step": 13150 | |
| }, | |
| { | |
| "loss": 0.0021208491921424866, | |
| "grad_norm": 0.04535406082868576, | |
| "learning_rate": 4.675635347676971e-05, | |
| "epoch": 5.303334672559261, | |
| "step": 13200 | |
| }, | |
| { | |
| "loss": 0.0013151970505714417, | |
| "grad_norm": 0.0014821949880570173, | |
| "learning_rate": 4.6435084817617805e-05, | |
| "epoch": 5.32342306147047, | |
| "step": 13250 | |
| }, | |
| { | |
| "loss": 3.317750990390778e-05, | |
| "grad_norm": 0.003384900977835059, | |
| "learning_rate": 4.611396402294364e-05, | |
| "epoch": 5.34351145038168, | |
| "step": 13300 | |
| }, | |
| { | |
| "loss": 0.0002364267036318779, | |
| "grad_norm": 0.0017969327745959163, | |
| "learning_rate": 4.579300441209881e-05, | |
| "epoch": 5.363599839292888, | |
| "step": 13350 | |
| }, | |
| { | |
| "loss": 0.0044511440396308895, | |
| "grad_norm": 0.00422246940433979, | |
| "learning_rate": 4.5472219297749306e-05, | |
| "epoch": 5.383688228204098, | |
| "step": 13400 | |
| }, | |
| { | |
| "loss": 0.006281139850616455, | |
| "grad_norm": 0.006894610356539488, | |
| "learning_rate": 4.515162198532349e-05, | |
| "epoch": 5.403776617115307, | |
| "step": 13450 | |
| }, | |
| { | |
| "loss": 0.005771521329879761, | |
| "grad_norm": 0.0020705130882561207, | |
| "learning_rate": 4.4831225772460045e-05, | |
| "epoch": 5.423865006026516, | |
| "step": 13500 | |
| }, | |
| { | |
| "eval_seen_loss": 0.010174693539738655, | |
| "eval_seen_accuracy": 0.9971316425120773, | |
| "eval_seen_f1_valid": 0.9977586410286657, | |
| "eval_seen_f1_invalid": 0.9960176063718298, | |
| "eval_seen_macro_f1": 0.9968881237002478, | |
| "eval_seen_majority_baseline": 0.6400966183574879, | |
| "eval_seen_runtime": 0.3169, | |
| "eval_seen_samples_per_second": 20903.498, | |
| "eval_seen_steps_per_second": 164.098, | |
| "epoch": 5.423865006026516, | |
| "step": 13500 | |
| }, | |
| { | |
| "eval_unseen_loss": 0.058374982327222824, | |
| "eval_unseen_accuracy": 0.9894323671497585, | |
| "eval_unseen_f1_valid": 0.99176664314279, | |
| "eval_unseen_f1_invalid": 0.9852507374631267, | |
| "eval_unseen_macro_f1": 0.9885086903029583, | |
| "eval_unseen_majority_baseline": 0.6400966183574879, | |
| "eval_unseen_runtime": 0.3043, | |
| "eval_unseen_samples_per_second": 21769.42, | |
| "eval_unseen_steps_per_second": 170.895, | |
| "epoch": 5.423865006026516, | |
| "step": 13500 | |
| }, | |
| { | |
| "loss": 0.0006757942587137223, | |
| "grad_norm": 0.004422497004270554, | |
| "learning_rate": 4.451104394845656e-05, | |
| "epoch": 5.443953394937726, | |
| "step": 13550 | |
| }, | |
| { | |
| "loss": 0.0002531594038009644, | |
| "grad_norm": 0.001529279863461852, | |
| "learning_rate": 4.419108979371825e-05, | |
| "epoch": 5.464041783848935, | |
| "step": 13600 | |
| }, | |
| { | |
| "loss": 0.0036075374484062193, | |
| "grad_norm": 0.006333576515316963, | |
| "learning_rate": 4.387137657920714e-05, | |
| "epoch": 5.484130172760144, | |
| "step": 13650 | |
| }, | |
| { | |
| "loss": 0.00012090455740690231, | |
| "grad_norm": 0.0038246733602136374, | |
| "learning_rate": 4.355191756589162e-05, | |
| "epoch": 5.504218561671354, | |
| "step": 13700 | |
| }, | |
| { | |
| "loss": 0.001714312881231308, | |
| "grad_norm": 0.005397704429924488, | |
| "learning_rate": 4.323272600419636e-05, | |
| "epoch": 5.524306950582563, | |
| "step": 13750 | |
| }, | |
| { | |
| "loss": 0.0036899104714393617, | |
| "grad_norm": 5.890677452087402, | |
| "learning_rate": 4.2913815133452775e-05, | |
| "epoch": 5.544395339493772, | |
| "step": 13800 | |
| }, | |
| { | |
| "loss": 0.00011864371597766876, | |
| "grad_norm": 0.0025099259801208973, | |
| "learning_rate": 4.2595198181349906e-05, | |
| "epoch": 5.564483728404982, | |
| "step": 13850 | |
| }, | |
| { | |
| "loss": 0.0008606189489364625, | |
| "grad_norm": 0.0009816354140639305, | |
| "learning_rate": 4.2276888363385654e-05, | |
| "epoch": 5.584572117316191, | |
| "step": 13900 | |
| }, | |
| { | |
| "loss": 0.0009802313148975373, | |
| "grad_norm": 0.0008119562990032136, | |
| "learning_rate": 4.195889888231875e-05, | |
| "epoch": 5.6046605062274, | |
| "step": 13950 | |
| }, | |
| { | |
| "loss": 0.0024506640434265137, | |
| "grad_norm": 0.000700517965015024, | |
| "learning_rate": 4.164124292762105e-05, | |
| "epoch": 5.62474889513861, | |
| "step": 14000 | |
| }, | |
| { | |
| "eval_seen_loss": 0.009596684016287327, | |
| "eval_seen_accuracy": 0.9978864734299517, | |
| "eval_seen_f1_valid": 0.9983498349834984, | |
| "eval_seen_f1_invalid": 0.9970612930310664, | |
| "eval_seen_macro_f1": 0.9977055640072824, | |
| "eval_seen_majority_baseline": 0.6400966183574879, | |
| "eval_seen_runtime": 0.3205, | |
| "eval_seen_samples_per_second": 20670.343, | |
| "eval_seen_steps_per_second": 162.267, | |
| "epoch": 5.62474889513861, | |
| "step": 14000 | |
| }, | |
| { | |
| "eval_unseen_loss": 0.08425682038068771, | |
| "eval_unseen_accuracy": 0.9808272946859904, | |
| "eval_unseen_f1_valid": 0.9849186557415984, | |
| "eval_unseen_f1_invalid": 0.9736896623161384, | |
| "eval_unseen_macro_f1": 0.9793041590288685, | |
| "eval_unseen_majority_baseline": 0.6400966183574879, | |
| "eval_unseen_runtime": 0.3167, | |
| "eval_unseen_samples_per_second": 20912.766, | |
| "eval_unseen_steps_per_second": 164.17, | |
| "epoch": 5.62474889513861, | |
| "step": 14000 | |
| }, | |
| { | |
| "loss": 0.0036605629324913025, | |
| "grad_norm": 0.00505917239934206, | |
| "learning_rate": 4.1323933674930546e-05, | |
| "epoch": 5.644837284049819, | |
| "step": 14050 | |
| }, | |
| { | |
| "loss": 0.0009563095867633819, | |
| "grad_norm": 0.004556451458483934, | |
| "learning_rate": 4.100698428550483e-05, | |
| "epoch": 5.6649256729610284, | |
| "step": 14100 | |
| }, | |
| { | |
| "loss": 0.0005329408496618271, | |
| "grad_norm": 0.0008073868812061846, | |
| "learning_rate": 4.069040790567514e-05, | |
| "epoch": 5.685014061872238, | |
| "step": 14150 | |
| }, | |
| { | |
| "loss": 0.0020050498843193054, | |
| "grad_norm": 6.619334697723389, | |
| "learning_rate": 4.0374217666301165e-05, | |
| "epoch": 5.705102450783447, | |
| "step": 14200 | |
| }, | |
| { | |
| "loss": 0.006490317583084107, | |
| "grad_norm": 0.0027281667571514845, | |
| "learning_rate": 4.0058426682226404e-05, | |
| "epoch": 5.7251908396946565, | |
| "step": 14250 | |
| }, | |
| { | |
| "loss": 0.0007787179946899414, | |
| "grad_norm": 0.004724098369479179, | |
| "learning_rate": 3.974304805173415e-05, | |
| "epoch": 5.745279228605866, | |
| "step": 14300 | |
| }, | |
| { | |
| "loss": 3.9987266063690186e-05, | |
| "grad_norm": 0.0007951312582008541, | |
| "learning_rate": 3.942809485600417e-05, | |
| "epoch": 5.765367617517075, | |
| "step": 14350 | |
| }, | |
| { | |
| "loss": 0.00021765440702438356, | |
| "grad_norm": 0.008279331028461456, | |
| "learning_rate": 3.911358015857023e-05, | |
| "epoch": 5.7854560064282845, | |
| "step": 14400 | |
| }, | |
| { | |
| "loss": 0.003879154920578003, | |
| "grad_norm": 0.1304825246334076, | |
| "learning_rate": 3.879951700477821e-05, | |
| "epoch": 5.805544395339494, | |
| "step": 14450 | |
| }, | |
| { | |
| "loss": 0.004461580812931061, | |
| "grad_norm": 0.002032057149335742, | |
| "learning_rate": 3.8485918421244934e-05, | |
| "epoch": 5.825632784250703, | |
| "step": 14500 | |
| }, | |
| { | |
| "eval_seen_loss": 0.010054807178676128, | |
| "eval_seen_accuracy": 0.9977355072463768, | |
| "eval_seen_f1_valid": 0.9982305060752625, | |
| "eval_seen_f1_invalid": 0.996856005030392, | |
| "eval_seen_macro_f1": 0.9975432555528272, | |
| "eval_seen_majority_baseline": 0.6400966183574879, | |
| "eval_seen_runtime": 0.3332, | |
| "eval_seen_samples_per_second": 19879.214, | |
| "eval_seen_steps_per_second": 156.057, | |
| "epoch": 5.825632784250703, | |
| "step": 14500 | |
| }, | |
| { | |
| "eval_unseen_loss": 0.07361596077680588, | |
| "eval_unseen_accuracy": 0.9846014492753623, | |
| "eval_unseen_f1_valid": 0.9879289940828402, | |
| "eval_unseen_f1_invalid": 0.9787411421425594, | |
| "eval_unseen_macro_f1": 0.9833350681126998, | |
| "eval_unseen_majority_baseline": 0.6400966183574879, | |
| "eval_unseen_runtime": 0.2998, | |
| "eval_unseen_samples_per_second": 22098.303, | |
| "eval_unseen_steps_per_second": 173.477, | |
| "epoch": 5.825632784250703, | |
| "step": 14500 | |
| }, | |
| { | |
| "loss": 0.00021345250308513642, | |
| "grad_norm": 0.0009313533664681017, | |
| "learning_rate": 3.8172797415317974e-05, | |
| "epoch": 5.8457211731619125, | |
| "step": 14550 | |
| }, | |
| { | |
| "loss": 0.0028869000077247618, | |
| "grad_norm": 0.002781760646030307, | |
| "learning_rate": 3.786016697453604e-05, | |
| "epoch": 5.865809562073122, | |
| "step": 14600 | |
| }, | |
| { | |
| "loss": 0.0006874355673789978, | |
| "grad_norm": 0.005940814968198538, | |
| "learning_rate": 3.7548040066090386e-05, | |
| "epoch": 5.885897950984331, | |
| "step": 14650 | |
| }, | |
| { | |
| "loss": 0.002895154058933258, | |
| "grad_norm": 0.005510283168405294, | |
| "learning_rate": 3.723642963628686e-05, | |
| "epoch": 5.905986339895541, | |
| "step": 14700 | |
| }, | |
| { | |
| "loss": 0.001371142715215683, | |
| "grad_norm": 0.024149959906935692, | |
| "learning_rate": 3.692534861000897e-05, | |
| "epoch": 5.92607472880675, | |
| "step": 14750 | |
| }, | |
| { | |
| "loss": 0.0004990202561020852, | |
| "grad_norm": 2.1117215156555176, | |
| "learning_rate": 3.661480989018177e-05, | |
| "epoch": 5.946163117717959, | |
| "step": 14800 | |
| }, | |
| { | |
| "loss": 0.0032197386026382446, | |
| "grad_norm": 0.0015058110002428293, | |
| "learning_rate": 3.6304826357236765e-05, | |
| "epoch": 5.966251506629169, | |
| "step": 14850 | |
| }, | |
| { | |
| "loss": 0.0005698489025235176, | |
| "grad_norm": 0.004746470134705305, | |
| "learning_rate": 3.599541086857748e-05, | |
| "epoch": 5.986339895540378, | |
| "step": 14900 | |
| }, | |
| { | |
| "loss": 0.0002272239327430725, | |
| "grad_norm": 0.0004718729469459504, | |
| "learning_rate": 3.5686576258046344e-05, | |
| "epoch": 6.006428284451587, | |
| "step": 14950 | |
| }, | |
| { | |
| "loss": 0.0030455261468887327, | |
| "grad_norm": 0.03686371073126793, | |
| "learning_rate": 3.5378335335392245e-05, | |
| "epoch": 6.026516673362797, | |
| "step": 15000 | |
| }, | |
| { | |
| "eval_seen_loss": 0.01733102835714817, | |
| "eval_seen_accuracy": 0.9977355072463768, | |
| "eval_seen_f1_valid": 0.9982321744254568, | |
| "eval_seen_f1_invalid": 0.9968507243334034, | |
| "eval_seen_macro_f1": 0.9975414493794301, | |
| "eval_seen_majority_baseline": 0.6400966183574879, | |
| "eval_seen_runtime": 0.3365, | |
| "eval_seen_samples_per_second": 19686.252, | |
| "eval_seen_steps_per_second": 154.542, | |
| "epoch": 6.026516673362797, | |
| "step": 15000 | |
| }, | |
| { | |
| "eval_unseen_loss": 0.06736034899950027, | |
| "eval_unseen_accuracy": 0.986262077294686, | |
| "eval_unseen_f1_valid": 0.989237137788291, | |
| "eval_unseen_f1_invalid": 0.9810139787189651, | |
| "eval_unseen_macro_f1": 0.985125558253628, | |
| "eval_unseen_majority_baseline": 0.6400966183574879, | |
| "eval_unseen_runtime": 0.3306, | |
| "eval_unseen_samples_per_second": 20034.851, | |
| "eval_unseen_steps_per_second": 157.278, | |
| "epoch": 6.026516673362797, | |
| "step": 15000 | |
| }, | |
| { | |
| "loss": 0.00037648912519216537, | |
| "grad_norm": 0.000664414488710463, | |
| "learning_rate": 3.507070088573934e-05, | |
| "epoch": 6.046605062274006, | |
| "step": 15050 | |
| }, | |
| { | |
| "loss": 0.0020931462943553926, | |
| "grad_norm": 0.009824547916650772, | |
| "learning_rate": 3.4763685669056607e-05, | |
| "epoch": 6.066693451185215, | |
| "step": 15100 | |
| }, | |
| { | |
| "loss": 0.0007150228321552277, | |
| "grad_norm": 0.0012331090401858091, | |
| "learning_rate": 3.4457302419628706e-05, | |
| "epoch": 6.086781840096425, | |
| "step": 15150 | |
| }, | |
| { | |
| "loss": 2.3746751248836518e-05, | |
| "grad_norm": 0.0010286089964210987, | |
| "learning_rate": 3.4151563845527714e-05, | |
| "epoch": 6.106870229007634, | |
| "step": 15200 | |
| }, | |
| { | |
| "loss": 4.286464303731918e-05, | |
| "grad_norm": 0.0036701043136417866, | |
| "learning_rate": 3.3846482628086104e-05, | |
| "epoch": 6.126958617918843, | |
| "step": 15250 | |
| }, | |
| { | |
| "loss": 0.0011537586152553557, | |
| "grad_norm": 0.0007002303609624505, | |
| "learning_rate": 3.35420714213707e-05, | |
| "epoch": 6.147047006830052, | |
| "step": 15300 | |
| }, | |
| { | |
| "loss": 0.0002453260496258736, | |
| "grad_norm": 0.0014305695658549666, | |
| "learning_rate": 3.3238342851657786e-05, | |
| "epoch": 6.167135395741261, | |
| "step": 15350 | |
| }, | |
| { | |
| "loss": 0.0010268088430166245, | |
| "grad_norm": 0.02988343872129917, | |
| "learning_rate": 3.293530951690944e-05, | |
| "epoch": 6.1872237846524705, | |
| "step": 15400 | |
| }, | |
| { | |
| "loss": 0.0021796417236328125, | |
| "grad_norm": 0.0006717279902659357, | |
| "learning_rate": 3.263298398625106e-05, | |
| "epoch": 6.20731217356368, | |
| "step": 15450 | |
| }, | |
| { | |
| "loss": 5.535826086997986e-05, | |
| "grad_norm": 0.001610444625839591, | |
| "learning_rate": 3.2331378799449875e-05, | |
| "epoch": 6.227400562474889, | |
| "step": 15500 | |
| }, | |
| { | |
| "eval_seen_loss": 0.016191324219107628, | |
| "eval_seen_accuracy": 0.9972826086956522, | |
| "eval_seen_f1_valid": 0.9978788592976667, | |
| "eval_seen_f1_invalid": 0.9962200755984879, | |
| "eval_seen_macro_f1": 0.9970494674480773, | |
| "eval_seen_majority_baseline": 0.6400966183574879, | |
| "eval_seen_runtime": 0.3199, | |
| "eval_seen_samples_per_second": 20706.021, | |
| "eval_seen_steps_per_second": 162.547, | |
| "epoch": 6.227400562474889, | |
| "step": 15500 | |
| }, | |
| { | |
| "eval_unseen_loss": 0.08634968847036362, | |
| "eval_unseen_accuracy": 0.9841485507246377, | |
| "eval_unseen_f1_valid": 0.987560715555029, | |
| "eval_unseen_f1_invalid": 0.9781568545870605, | |
| "eval_unseen_macro_f1": 0.9828587850710447, | |
| "eval_unseen_majority_baseline": 0.6400966183574879, | |
| "eval_unseen_runtime": 0.3057, | |
| "eval_unseen_samples_per_second": 21665.898, | |
| "eval_unseen_steps_per_second": 170.083, | |
| "epoch": 6.227400562474889, | |
| "step": 15500 | |
| }, | |
| { | |
| "loss": 0.002557535767555237, | |
| "grad_norm": 0.0008218715083785355, | |
| "learning_rate": 3.203050646639496e-05, | |
| "epoch": 6.2474889513860985, | |
| "step": 15550 | |
| }, | |
| { | |
| "loss": 0.0009405004978179931, | |
| "grad_norm": 0.0009019052959047258, | |
| "learning_rate": 3.1730379466578266e-05, | |
| "epoch": 6.267577340297308, | |
| "step": 15600 | |
| }, | |
| { | |
| "loss": 0.0013148632645606994, | |
| "grad_norm": 0.0005091215716674924, | |
| "learning_rate": 3.143101024857708e-05, | |
| "epoch": 6.287665729208517, | |
| "step": 15650 | |
| }, | |
| { | |
| "loss": 0.0036501625180244447, | |
| "grad_norm": 0.002635682700201869, | |
| "learning_rate": 3.113241122953761e-05, | |
| "epoch": 6.3077541181197265, | |
| "step": 15700 | |
| }, | |
| { | |
| "loss": 0.0032262831926345827, | |
| "grad_norm": 0.0013482654467225075, | |
| "learning_rate": 3.0834594794659994e-05, | |
| "epoch": 6.327842507030936, | |
| "step": 15750 | |
| }, | |
| { | |
| "loss": 0.00024218712002038956, | |
| "grad_norm": 0.000721741293091327, | |
| "learning_rate": 3.053757329668457e-05, | |
| "epoch": 6.347930895942145, | |
| "step": 15800 | |
| }, | |
| { | |
| "loss": 3.9498805999755856e-05, | |
| "grad_norm": 0.00035534962080419064, | |
| "learning_rate": 3.024135905537956e-05, | |
| "epoch": 6.3680192848533546, | |
| "step": 15850 | |
| }, | |
| { | |
| "loss": 1.3891272246837615e-05, | |
| "grad_norm": 0.000355778553057462, | |
| "learning_rate": 2.9945964357029987e-05, | |
| "epoch": 6.388107673764564, | |
| "step": 15900 | |
| }, | |
| { | |
| "loss": 3.9079450070858e-05, | |
| "grad_norm": 0.07650864869356155, | |
| "learning_rate": 2.9651401453928163e-05, | |
| "epoch": 6.408196062675773, | |
| "step": 15950 | |
| }, | |
| { | |
| "loss": 0.00021860454231500625, | |
| "grad_norm": 0.0003715547500178218, | |
| "learning_rate": 2.9357682563865373e-05, | |
| "epoch": 6.428284451586983, | |
| "step": 16000 | |
| }, | |
| { | |
| "eval_seen_loss": 0.014586011879146099, | |
| "eval_seen_accuracy": 0.9978864734299517, | |
| "eval_seen_f1_valid": 0.9983494458854045, | |
| "eval_seen_f1_invalid": 0.9970625262274444, | |
| "eval_seen_macro_f1": 0.9977059860564245, | |
| "eval_seen_majority_baseline": 0.6400966183574879, | |
| "eval_seen_runtime": 0.3205, | |
| "eval_seen_samples_per_second": 20666.622, | |
| "eval_seen_steps_per_second": 162.238, | |
| "epoch": 6.428284451586983, | |
| "step": 16000 | |
| }, | |
| { | |
| "eval_unseen_loss": 0.06505319476127625, | |
| "eval_unseen_accuracy": 0.988677536231884, | |
| "eval_unseen_f1_valid": 0.9911650371068441, | |
| "eval_unseen_f1_invalid": 0.9842403866358479, | |
| "eval_unseen_macro_f1": 0.987702711871346, | |
| "eval_unseen_majority_baseline": 0.6400966183574879, | |
| "eval_unseen_runtime": 0.2959, | |
| "eval_unseen_samples_per_second": 22385.627, | |
| "eval_unseen_steps_per_second": 175.733, | |
| "epoch": 6.428284451586983, | |
| "step": 16000 | |
| }, | |
| { | |
| "loss": 1.775696873664856e-05, | |
| "grad_norm": 0.0004017347819171846, | |
| "learning_rate": 2.9064819869625314e-05, | |
| "epoch": 6.448372840498192, | |
| "step": 16050 | |
| }, | |
| { | |
| "loss": 0.00019178256392478942, | |
| "grad_norm": 0.0005201531457714736, | |
| "learning_rate": 2.8772825518478525e-05, | |
| "epoch": 6.468461229409401, | |
| "step": 16100 | |
| }, | |
| { | |
| "loss": 1.9734539091587066e-05, | |
| "grad_norm": 0.0006806280580349267, | |
| "learning_rate": 2.848171162167871e-05, | |
| "epoch": 6.488549618320611, | |
| "step": 16150 | |
| }, | |
| { | |
| "loss": 0.0001803133264183998, | |
| "grad_norm": 0.0003293660993222147, | |
| "learning_rate": 2.8191490253960375e-05, | |
| "epoch": 6.50863800723182, | |
| "step": 16200 | |
| }, | |
| { | |
| "loss": 1.029331237077713e-05, | |
| "grad_norm": 0.0003172715369146317, | |
| "learning_rate": 2.7902173453037982e-05, | |
| "epoch": 6.528726396143029, | |
| "step": 16250 | |
| }, | |
| { | |
| "loss": 0.0013763304054737091, | |
| "grad_norm": 3.6225039958953857, | |
| "learning_rate": 2.761377321910661e-05, | |
| "epoch": 6.548814785054239, | |
| "step": 16300 | |
| }, | |
| { | |
| "loss": 0.0025291353464126586, | |
| "grad_norm": 0.0003018236602656543, | |
| "learning_rate": 2.7326301514344256e-05, | |
| "epoch": 6.568903173965448, | |
| "step": 16350 | |
| }, | |
| { | |
| "loss": 0.002325804829597473, | |
| "grad_norm": 0.00033842388074845076, | |
| "learning_rate": 2.7039770262415655e-05, | |
| "epoch": 6.588991562876657, | |
| "step": 16400 | |
| }, | |
| { | |
| "loss": 0.0033012521266937256, | |
| "grad_norm": 0.0036098379641771317, | |
| "learning_rate": 2.6754191347977748e-05, | |
| "epoch": 6.609079951787867, | |
| "step": 16450 | |
| }, | |
| { | |
| "loss": 0.0001065874844789505, | |
| "grad_norm": 0.00032605676096864045, | |
| "learning_rate": 2.646957661618672e-05, | |
| "epoch": 6.629168340699076, | |
| "step": 16500 | |
| }, | |
| { | |
| "eval_seen_loss": 0.013449776917696, | |
| "eval_seen_accuracy": 0.9978864734299517, | |
| "eval_seen_f1_valid": 0.9983502238981853, | |
| "eval_seen_f1_invalid": 0.997060058798824, | |
| "eval_seen_macro_f1": 0.9977051413485046, | |
| "eval_seen_majority_baseline": 0.6400966183574879, | |
| "eval_seen_runtime": 0.3205, | |
| "eval_seen_samples_per_second": 20670.42, | |
| "eval_seen_steps_per_second": 162.268, | |
| "epoch": 6.629168340699076, | |
| "step": 16500 | |
| }, | |
| { | |
| "eval_unseen_loss": 0.06277448683977127, | |
| "eval_unseen_accuracy": 0.9898852657004831, | |
| "eval_unseen_f1_valid": 0.9921130076515596, | |
| "eval_unseen_f1_invalid": 0.985903639806438, | |
| "eval_unseen_macro_f1": 0.9890083237289988, | |
| "eval_unseen_majority_baseline": 0.6400966183574879, | |
| "eval_unseen_runtime": 0.3053, | |
| "eval_unseen_samples_per_second": 21694.422, | |
| "eval_unseen_steps_per_second": 170.306, | |
| "epoch": 6.629168340699076, | |
| "step": 16500 | |
| }, | |
| { | |
| "loss": 2.7056075632572176e-05, | |
| "grad_norm": 0.0002598020655568689, | |
| "learning_rate": 2.6185937872206645e-05, | |
| "epoch": 6.649256729610285, | |
| "step": 16550 | |
| }, | |
| { | |
| "loss": 1.0665915906429291e-05, | |
| "grad_norm": 0.00029112983611412346, | |
| "learning_rate": 2.5903286880719852e-05, | |
| "epoch": 6.669345118521495, | |
| "step": 16600 | |
| }, | |
| { | |
| "loss": 2.9137618839740752e-05, | |
| "grad_norm": 0.00034989695996046066, | |
| "learning_rate": 2.5621635365439034e-05, | |
| "epoch": 6.689433507432704, | |
| "step": 16650 | |
| }, | |
| { | |
| "loss": 0.0004712997749447823, | |
| "grad_norm": 0.00025116666802205145, | |
| "learning_rate": 2.534099500862085e-05, | |
| "epoch": 6.709521896343913, | |
| "step": 16700 | |
| }, | |
| { | |
| "loss": 1.5728212893009187e-05, | |
| "grad_norm": 0.0003110774850938469, | |
| "learning_rate": 2.506137745058148e-05, | |
| "epoch": 6.729610285255123, | |
| "step": 16750 | |
| }, | |
| { | |
| "loss": 0.0017288799583911895, | |
| "grad_norm": 0.002883067587390542, | |
| "learning_rate": 2.478279428921371e-05, | |
| "epoch": 6.749698674166332, | |
| "step": 16800 | |
| }, | |
| { | |
| "loss": 0.002549371421337128, | |
| "grad_norm": 0.00043419309076853096, | |
| "learning_rate": 2.4505257079506012e-05, | |
| "epoch": 6.769787063077541, | |
| "step": 16850 | |
| }, | |
| { | |
| "loss": 8.197244256734849e-05, | |
| "grad_norm": 0.0023284712806344032, | |
| "learning_rate": 2.422877733306309e-05, | |
| "epoch": 6.789875451988751, | |
| "step": 16900 | |
| }, | |
| { | |
| "loss": 3.0123256146907805e-05, | |
| "grad_norm": 0.006009037606418133, | |
| "learning_rate": 2.3953366517628607e-05, | |
| "epoch": 6.80996384089996, | |
| "step": 16950 | |
| }, | |
| { | |
| "loss": 0.001429406851530075, | |
| "grad_norm": 0.010161327198147774, | |
| "learning_rate": 2.367903605660934e-05, | |
| "epoch": 6.830052229811169, | |
| "step": 17000 | |
| }, | |
| { | |
| "eval_seen_loss": 0.01531138364225626, | |
| "eval_seen_accuracy": 0.9978864734299517, | |
| "eval_seen_f1_valid": 0.9983502238981853, | |
| "eval_seen_f1_invalid": 0.997060058798824, | |
| "eval_seen_macro_f1": 0.9977051413485046, | |
| "eval_seen_majority_baseline": 0.6400966183574879, | |
| "eval_seen_runtime": 0.3346, | |
| "eval_seen_samples_per_second": 19798.834, | |
| "eval_seen_steps_per_second": 155.426, | |
| "epoch": 6.830052229811169, | |
| "step": 17000 | |
| }, | |
| { | |
| "eval_unseen_loss": 0.09234398603439331, | |
| "eval_unseen_accuracy": 0.9865640096618358, | |
| "eval_unseen_f1_valid": 0.989488602810913, | |
| "eval_unseen_f1_invalid": 0.9813846475632713, | |
| "eval_unseen_macro_f1": 0.9854366251870921, | |
| "eval_unseen_majority_baseline": 0.6400966183574879, | |
| "eval_unseen_runtime": 0.3053, | |
| "eval_unseen_samples_per_second": 21698.031, | |
| "eval_unseen_steps_per_second": 170.335, | |
| "epoch": 6.830052229811169, | |
| "step": 17000 | |
| }, | |
| { | |
| "loss": 0.004940186142921448, | |
| "grad_norm": 0.0007521524094045162, | |
| "learning_rate": 2.340579732860152e-05, | |
| "epoch": 6.850140618722379, | |
| "step": 17050 | |
| }, | |
| { | |
| "loss": 2.277746796607971e-05, | |
| "grad_norm": 0.0003301052493043244, | |
| "learning_rate": 2.3133661666918765e-05, | |
| "epoch": 6.870229007633588, | |
| "step": 17100 | |
| }, | |
| { | |
| "loss": 3.1196326017379763e-05, | |
| "grad_norm": 0.00048009969759732485, | |
| "learning_rate": 2.2862640359122027e-05, | |
| "epoch": 6.8903173965447975, | |
| "step": 17150 | |
| }, | |
| { | |
| "loss": 1.5532001852989197e-05, | |
| "grad_norm": 0.0003433611709624529, | |
| "learning_rate": 2.259274464655147e-05, | |
| "epoch": 6.910405785456007, | |
| "step": 17200 | |
| }, | |
| { | |
| "loss": 0.0006354102492332459, | |
| "grad_norm": 0.0005477304221130908, | |
| "learning_rate": 2.2323985723860148e-05, | |
| "epoch": 6.930494174367215, | |
| "step": 17250 | |
| }, | |
| { | |
| "loss": 0.00010105263441801071, | |
| "grad_norm": 0.001819954952225089, | |
| "learning_rate": 2.2056374738549657e-05, | |
| "epoch": 6.9505825632784255, | |
| "step": 17300 | |
| }, | |
| { | |
| "loss": 0.0024885176122188568, | |
| "grad_norm": 0.00035599080729298294, | |
| "learning_rate": 2.1789922790507816e-05, | |
| "epoch": 6.970670952189634, | |
| "step": 17350 | |
| }, | |
| { | |
| "loss": 0.000506746768951416, | |
| "grad_norm": 0.002056804718449712, | |
| "learning_rate": 2.152464093154821e-05, | |
| "epoch": 6.990759341100844, | |
| "step": 17400 | |
| }, | |
| { | |
| "loss": 3.9716772735118864e-05, | |
| "grad_norm": 0.0003199533966835588, | |
| "learning_rate": 2.126054016495188e-05, | |
| "epoch": 7.010847730012053, | |
| "step": 17450 | |
| }, | |
| { | |
| "loss": 2.2945143282413483e-05, | |
| "grad_norm": 0.0002348485286347568, | |
| "learning_rate": 2.0997631445010858e-05, | |
| "epoch": 7.030936118923262, | |
| "step": 17500 | |
| }, | |
| { | |
| "eval_seen_loss": 0.01327558420598507, | |
| "eval_seen_accuracy": 0.9977355072463768, | |
| "eval_seen_f1_valid": 0.9982325910215624, | |
| "eval_seen_f1_invalid": 0.9968494013862634, | |
| "eval_seen_macro_f1": 0.9975409962039129, | |
| "eval_seen_majority_baseline": 0.6400966183574879, | |
| "eval_seen_runtime": 0.3251, | |
| "eval_seen_samples_per_second": 20376.02, | |
| "eval_seen_steps_per_second": 159.957, | |
| "epoch": 7.030936118923262, | |
| "step": 17500 | |
| }, | |
| { | |
| "eval_unseen_loss": 0.08052626252174377, | |
| "eval_unseen_accuracy": 0.9871678743961353, | |
| "eval_unseen_f1_valid": 0.9899752329284113, | |
| "eval_unseen_f1_invalid": 0.982176556930174, | |
| "eval_unseen_macro_f1": 0.9860758949292927, | |
| "eval_unseen_majority_baseline": 0.6400966183574879, | |
| "eval_unseen_runtime": 0.3089, | |
| "eval_unseen_samples_per_second": 21446.92, | |
| "eval_unseen_steps_per_second": 168.364, | |
| "epoch": 7.030936118923262, | |
| "step": 17500 | |
| }, | |
| { | |
| "loss": 1.6945749521255494e-05, | |
| "grad_norm": 0.00024341772950720042, | |
| "learning_rate": 2.0735925676573785e-05, | |
| "epoch": 7.051024507834471, | |
| "step": 17550 | |
| }, | |
| { | |
| "loss": 0.0011683499813079834, | |
| "grad_norm": 0.000335768359946087, | |
| "learning_rate": 2.047543371459366e-05, | |
| "epoch": 7.071112896745681, | |
| "step": 17600 | |
| }, | |
| { | |
| "loss": 0.004646786451339722, | |
| "grad_norm": 0.00035198635305278003, | |
| "learning_rate": 2.021616636367762e-05, | |
| "epoch": 7.09120128565689, | |
| "step": 17650 | |
| }, | |
| { | |
| "loss": 0.00020644064992666244, | |
| "grad_norm": 0.0004466926911845803, | |
| "learning_rate": 1.9958134377638687e-05, | |
| "epoch": 7.111289674568099, | |
| "step": 17700 | |
| }, | |
| { | |
| "loss": 6.792254745960235e-05, | |
| "grad_norm": 0.0007776455604471266, | |
| "learning_rate": 1.9701348459049874e-05, | |
| "epoch": 7.131378063479309, | |
| "step": 17750 | |
| }, | |
| { | |
| "loss": 0.0004381958022713661, | |
| "grad_norm": 0.0003025882178917527, | |
| "learning_rate": 1.944581925880009e-05, | |
| "epoch": 7.151466452390518, | |
| "step": 17800 | |
| }, | |
| { | |
| "loss": 6.515607237815857e-06, | |
| "grad_norm": 0.00025550602003932, | |
| "learning_rate": 1.9191557375652546e-05, | |
| "epoch": 7.171554841301727, | |
| "step": 17850 | |
| }, | |
| { | |
| "loss": 8.427612483501434e-06, | |
| "grad_norm": 0.00029596281819976866, | |
| "learning_rate": 1.893857335580499e-05, | |
| "epoch": 7.191643230212937, | |
| "step": 17900 | |
| }, | |
| { | |
| "loss": 9.106919169425964e-06, | |
| "grad_norm": 0.0002097087271977216, | |
| "learning_rate": 1.868687769245239e-05, | |
| "epoch": 7.211731619124146, | |
| "step": 17950 | |
| }, | |
| { | |
| "loss": 1.7725974321365355e-05, | |
| "grad_norm": 0.0005719594773836434, | |
| "learning_rate": 1.8436480825351605e-05, | |
| "epoch": 7.231820008035355, | |
| "step": 18000 | |
| }, | |
| { | |
| "eval_seen_loss": 0.014237217605113983, | |
| "eval_seen_accuracy": 0.9977355072463768, | |
| "eval_seen_f1_valid": 0.998231340643792, | |
| "eval_seen_f1_invalid": 0.9968533668974197, | |
| "eval_seen_macro_f1": 0.9975423537706058, | |
| "eval_seen_majority_baseline": 0.6400966183574879, | |
| "eval_seen_runtime": 0.3163, | |
| "eval_seen_samples_per_second": 20941.881, | |
| "eval_seen_steps_per_second": 164.399, | |
| "epoch": 7.231820008035355, | |
| "step": 18000 | |
| }, | |
| { | |
| "eval_unseen_loss": 0.05696876347064972, | |
| "eval_unseen_accuracy": 0.9909420289855072, | |
| "eval_unseen_f1_valid": 0.9929245283018868, | |
| "eval_unseen_f1_invalid": 0.9874161073825504, | |
| "eval_unseen_macro_f1": 0.9901703178422185, | |
| "eval_unseen_majority_baseline": 0.6400966183574879, | |
| "eval_unseen_runtime": 0.3145, | |
| "eval_unseen_samples_per_second": 21061.294, | |
| "eval_unseen_steps_per_second": 165.336, | |
| "epoch": 7.231820008035355, | |
| "step": 18000 | |
| }, | |
| { | |
| "loss": 6.993412971496582e-06, | |
| "grad_norm": 0.0002458687813486904, | |
| "learning_rate": 1.818739314038847e-05, | |
| "epoch": 7.251908396946565, | |
| "step": 18050 | |
| }, | |
| { | |
| "loss": 0.0008838069438934326, | |
| "grad_norm": 0.0003040506271645427, | |
| "learning_rate": 1.793962496914691e-05, | |
| "epoch": 7.271996785857774, | |
| "step": 18100 | |
| }, | |
| { | |
| "loss": 0.00013988766819238662, | |
| "grad_norm": 0.0010905415983870625, | |
| "learning_rate": 1.769318658848046e-05, | |
| "epoch": 7.292085174768983, | |
| "step": 18150 | |
| }, | |
| { | |
| "loss": 4.3235272169113156e-05, | |
| "grad_norm": 0.0003398769476916641, | |
| "learning_rate": 1.7448088220086028e-05, | |
| "epoch": 7.312173563680193, | |
| "step": 18200 | |
| }, | |
| { | |
| "loss": 5.77002763748169e-06, | |
| "grad_norm": 0.000229157623834908, | |
| "learning_rate": 1.7204340030079912e-05, | |
| "epoch": 7.332261952591402, | |
| "step": 18250 | |
| }, | |
| { | |
| "loss": 6.55684620141983e-06, | |
| "grad_norm": 0.00021728631691075861, | |
| "learning_rate": 1.6961952128576064e-05, | |
| "epoch": 7.3523503415026115, | |
| "step": 18300 | |
| }, | |
| { | |
| "loss": 1.53171643614769e-05, | |
| "grad_norm": 0.00021770535386167467, | |
| "learning_rate": 1.6720934569266826e-05, | |
| "epoch": 7.372438730413821, | |
| "step": 18350 | |
| }, | |
| { | |
| "loss": 0.00031239636242389677, | |
| "grad_norm": 0.0006413852097466588, | |
| "learning_rate": 1.64812973490059e-05, | |
| "epoch": 7.39252711932503, | |
| "step": 18400 | |
| }, | |
| { | |
| "loss": 9.444206953048706e-06, | |
| "grad_norm": 0.00024652466527186334, | |
| "learning_rate": 1.6243050407393696e-05, | |
| "epoch": 7.4126155082362395, | |
| "step": 18450 | |
| }, | |
| { | |
| "loss": 3.102324903011322e-05, | |
| "grad_norm": 0.001528206979855895, | |
| "learning_rate": 1.6006203626365097e-05, | |
| "epoch": 7.432703897147449, | |
| "step": 18500 | |
| }, | |
| { | |
| "eval_seen_loss": 0.011784316040575504, | |
| "eval_seen_accuracy": 0.9980374396135265, | |
| "eval_seen_f1_valid": 0.9984678845020625, | |
| "eval_seen_f1_invalid": 0.9972706277556163, | |
| "eval_seen_macro_f1": 0.9978692561288394, | |
| "eval_seen_majority_baseline": 0.6400966183574879, | |
| "eval_seen_runtime": 0.3094, | |
| "eval_seen_samples_per_second": 21407.771, | |
| "eval_seen_steps_per_second": 168.056, | |
| "epoch": 7.432703897147449, | |
| "step": 18500 | |
| }, | |
| { | |
| "eval_unseen_loss": 0.04249073192477226, | |
| "eval_unseen_accuracy": 0.9936594202898551, | |
| "eval_unseen_f1_valid": 0.9950541686292981, | |
| "eval_unseen_f1_invalid": 0.9911690496215307, | |
| "eval_unseen_macro_f1": 0.9931116091254144, | |
| "eval_unseen_majority_baseline": 0.6400966183574879, | |
| "eval_unseen_runtime": 0.3055, | |
| "eval_unseen_samples_per_second": 21685.396, | |
| "eval_unseen_steps_per_second": 170.236, | |
| "epoch": 7.432703897147449, | |
| "step": 18500 | |
| }, | |
| { | |
| "loss": 5.453340709209442e-06, | |
| "grad_norm": 0.00019290638738311827, | |
| "learning_rate": 1.5770766829779498e-05, | |
| "epoch": 7.452792286058658, | |
| "step": 18550 | |
| }, | |
| { | |
| "loss": 1.5767738223075866e-05, | |
| "grad_norm": 0.0003964620118495077, | |
| "learning_rate": 1.5536749783013398e-05, | |
| "epoch": 7.4728806749698675, | |
| "step": 18600 | |
| }, | |
| { | |
| "loss": 2.11561843752861e-05, | |
| "grad_norm": 0.0002844040864147246, | |
| "learning_rate": 1.530416219255536e-05, | |
| "epoch": 7.492969063881077, | |
| "step": 18650 | |
| }, | |
| { | |
| "loss": 7.1339309215545654e-06, | |
| "grad_norm": 0.0002172449603676796, | |
| "learning_rate": 1.50730137056034e-05, | |
| "epoch": 7.513057452792286, | |
| "step": 18700 | |
| }, | |
| { | |
| "loss": 6.715469062328339e-06, | |
| "grad_norm": 0.00025726479361765087, | |
| "learning_rate": 1.4843313909664786e-05, | |
| "epoch": 7.5331458417034955, | |
| "step": 18750 | |
| }, | |
| { | |
| "loss": 1.2444481253623962e-05, | |
| "grad_norm": 0.0002705488004721701, | |
| "learning_rate": 1.4615072332158424e-05, | |
| "epoch": 7.553234230614705, | |
| "step": 18800 | |
| }, | |
| { | |
| "loss": 5.9470906853675845e-06, | |
| "grad_norm": 0.01123479101806879, | |
| "learning_rate": 1.4388298440019732e-05, | |
| "epoch": 7.573322619525914, | |
| "step": 18850 | |
| }, | |
| { | |
| "loss": 0.0002536303177475929, | |
| "grad_norm": 0.00019734656962100416, | |
| "learning_rate": 1.4163001639307843e-05, | |
| "epoch": 7.593411008437124, | |
| "step": 18900 | |
| }, | |
| { | |
| "loss": 2.517692744731903e-05, | |
| "grad_norm": 0.0017155244713649154, | |
| "learning_rate": 1.39391912748156e-05, | |
| "epoch": 7.613499397348333, | |
| "step": 18950 | |
| }, | |
| { | |
| "loss": 5.56260347366333e-06, | |
| "grad_norm": 0.0002527149044908583, | |
| "learning_rate": 1.371687662968183e-05, | |
| "epoch": 7.633587786259542, | |
| "step": 19000 | |
| }, | |
| { | |
| "eval_seen_loss": 0.011350261978805065, | |
| "eval_seen_accuracy": 0.9978864734299517, | |
| "eval_seen_f1_valid": 0.9983494458854045, | |
| "eval_seen_f1_invalid": 0.9970625262274444, | |
| "eval_seen_macro_f1": 0.9977059860564245, | |
| "eval_seen_majority_baseline": 0.6400966183574879, | |
| "eval_seen_runtime": 0.3144, | |
| "eval_seen_samples_per_second": 21067.587, | |
| "eval_seen_steps_per_second": 165.386, | |
| "epoch": 7.633587786259542, | |
| "step": 19000 | |
| }, | |
| { | |
| "eval_unseen_loss": 0.045558616518974304, | |
| "eval_unseen_accuracy": 0.9941123188405797, | |
| "eval_unseen_f1_valid": 0.9954112248499823, | |
| "eval_unseen_f1_invalid": 0.9917877447883765, | |
| "eval_unseen_macro_f1": 0.9935994848191794, | |
| "eval_unseen_majority_baseline": 0.6400966183574879, | |
| "eval_unseen_runtime": 0.305, | |
| "eval_unseen_samples_per_second": 21718.385, | |
| "eval_unseen_steps_per_second": 170.495, | |
| "epoch": 7.633587786259542, | |
| "step": 19000 | |
| }, | |
| { | |
| "loss": 1.60391628742218e-05, | |
| "grad_norm": 0.00019333165255375206, | |
| "learning_rate": 1.3496066925006435e-05, | |
| "epoch": 7.653676175170752, | |
| "step": 19050 | |
| }, | |
| { | |
| "loss": 1.3582371175289153e-05, | |
| "grad_norm": 0.000267647992586717, | |
| "learning_rate": 1.3276771319467785e-05, | |
| "epoch": 7.673764564081961, | |
| "step": 19100 | |
| }, | |
| { | |
| "loss": 7.217995822429657e-05, | |
| "grad_norm": 0.0003133589925710112, | |
| "learning_rate": 1.3058998908942922e-05, | |
| "epoch": 7.69385295299317, | |
| "step": 19150 | |
| }, | |
| { | |
| "loss": 1.6851797699928283e-05, | |
| "grad_norm": 0.010939225554466248, | |
| "learning_rate": 1.2842758726130283e-05, | |
| "epoch": 7.71394134190438, | |
| "step": 19200 | |
| }, | |
| { | |
| "loss": 4.377402365207672e-06, | |
| "grad_norm": 0.0005316520691849291, | |
| "learning_rate": 1.2628059740175024e-05, | |
| "epoch": 7.734029730815589, | |
| "step": 19250 | |
| }, | |
| { | |
| "loss": 0.00048248179256916047, | |
| "grad_norm": 0.0003787012828979641, | |
| "learning_rate": 1.2414910856296985e-05, | |
| "epoch": 7.754118119726797, | |
| "step": 19300 | |
| }, | |
| { | |
| "loss": 4.041831940412521e-05, | |
| "grad_norm": 0.00018383558199275285, | |
| "learning_rate": 1.2203320915421346e-05, | |
| "epoch": 7.774206508638008, | |
| "step": 19350 | |
| }, | |
| { | |
| "loss": 4.867933690547943e-05, | |
| "grad_norm": 0.0001739686558721587, | |
| "learning_rate": 1.1993298693811877e-05, | |
| "epoch": 7.794294897549216, | |
| "step": 19400 | |
| }, | |
| { | |
| "loss": 1.4136731624603272e-05, | |
| "grad_norm": 0.00019290608179289848, | |
| "learning_rate": 1.1784852902707073e-05, | |
| "epoch": 7.814383286460426, | |
| "step": 19450 | |
| }, | |
| { | |
| "loss": 4.587210714817047e-06, | |
| "grad_norm": 0.0001746905327308923, | |
| "learning_rate": 1.1577992187958615e-05, | |
| "epoch": 7.834471675371635, | |
| "step": 19500 | |
| }, | |
| { | |
| "eval_seen_loss": 0.012746668420732021, | |
| "eval_seen_accuracy": 0.9981884057971014, | |
| "eval_seen_f1_valid": 0.9985859061984445, | |
| "eval_seen_f1_invalid": 0.997480050398992, | |
| "eval_seen_macro_f1": 0.9980329782987183, | |
| "eval_seen_majority_baseline": 0.6400966183574879, | |
| "eval_seen_runtime": 0.3302, | |
| "eval_seen_samples_per_second": 20059.703, | |
| "eval_seen_steps_per_second": 157.474, | |
| "epoch": 7.834471675371635, | |
| "step": 19500 | |
| }, | |
| { | |
| "eval_unseen_loss": 0.04527498781681061, | |
| "eval_unseen_accuracy": 0.9933574879227053, | |
| "eval_unseen_f1_valid": 0.9948259642521167, | |
| "eval_unseen_f1_invalid": 0.990725126475548, | |
| "eval_unseen_macro_f1": 0.9927755453638323, | |
| "eval_unseen_majority_baseline": 0.6400966183574879, | |
| "eval_unseen_runtime": 0.3108, | |
| "eval_unseen_samples_per_second": 21311.347, | |
| "eval_unseen_steps_per_second": 167.299, | |
| "epoch": 7.834471675371635, | |
| "step": 19500 | |
| }, | |
| { | |
| "loss": 0.00014036081731319427, | |
| "grad_norm": 0.00023242826864589006, | |
| "learning_rate": 1.1372725129672896e-05, | |
| "epoch": 7.854560064282844, | |
| "step": 19550 | |
| }, | |
| { | |
| "loss": 5.762390792369842e-06, | |
| "grad_norm": 0.00019600246741902083, | |
| "learning_rate": 1.1169060241855095e-05, | |
| "epoch": 7.8746484531940535, | |
| "step": 19600 | |
| }, | |
| { | |
| "loss": 4.053488373756408e-06, | |
| "grad_norm": 0.00014491379261016846, | |
| "learning_rate": 1.0967005972056083e-05, | |
| "epoch": 7.894736842105263, | |
| "step": 19650 | |
| }, | |
| { | |
| "loss": 4.891790449619294e-06, | |
| "grad_norm": 0.0002486503799445927, | |
| "learning_rate": 1.0766570701021983e-05, | |
| "epoch": 7.914825231016472, | |
| "step": 19700 | |
| }, | |
| { | |
| "loss": 3.816671669483185e-06, | |
| "grad_norm": 0.00015516391431447119, | |
| "learning_rate": 1.056776274234656e-05, | |
| "epoch": 7.9349136199276815, | |
| "step": 19750 | |
| }, | |
| { | |
| "loss": 3.6293640732765198e-06, | |
| "grad_norm": 0.00014282570919021964, | |
| "learning_rate": 1.0370590342126412e-05, | |
| "epoch": 7.955002008838891, | |
| "step": 19800 | |
| }, | |
| { | |
| "loss": 4.312135279178619e-06, | |
| "grad_norm": 0.00013145770935807377, | |
| "learning_rate": 1.0175061678618969e-05, | |
| "epoch": 7.9750903977501, | |
| "step": 19850 | |
| }, | |
| { | |
| "loss": 1.159965991973877e-05, | |
| "grad_norm": 0.00013499190390575677, | |
| "learning_rate": 9.981184861903186e-06, | |
| "epoch": 7.9951787866613095, | |
| "step": 19900 | |
| }, | |
| { | |
| "loss": 3.3606216311454773e-06, | |
| "grad_norm": 0.00018055748660117388, | |
| "learning_rate": 9.78896793354328e-06, | |
| "epoch": 8.01526717557252, | |
| "step": 19950 | |
| }, | |
| { | |
| "loss": 5.6288763880729676e-06, | |
| "grad_norm": 0.00015812755736988038, | |
| "learning_rate": 9.59841886625506e-06, | |
| "epoch": 8.035355564483728, | |
| "step": 20000 | |
| }, | |
| { | |
| "eval_seen_loss": 0.011836923658847809, | |
| "eval_seen_accuracy": 0.9978864734299517, | |
| "eval_seen_f1_valid": 0.9983498349834984, | |
| "eval_seen_f1_invalid": 0.9970612930310664, | |
| "eval_seen_macro_f1": 0.9977055640072824, | |
| "eval_seen_majority_baseline": 0.6400966183574879, | |
| "eval_seen_runtime": 0.3249, | |
| "eval_seen_samples_per_second": 20390.795, | |
| "eval_seen_steps_per_second": 160.073, | |
| "epoch": 8.035355564483728, | |
| "step": 20000 | |
| }, | |
| { | |
| "eval_unseen_loss": 0.04228868708014488, | |
| "eval_unseen_accuracy": 0.9947161835748792, | |
| "eval_unseen_f1_valid": 0.9958808991408732, | |
| "eval_unseen_f1_invalid": 0.9926331298673964, | |
| "eval_unseen_macro_f1": 0.9942570145041347, | |
| "eval_unseen_majority_baseline": 0.6400966183574879, | |
| "eval_unseen_runtime": 0.3069, | |
| "eval_unseen_samples_per_second": 21586.008, | |
| "eval_unseen_steps_per_second": 169.455, | |
| "epoch": 8.035355564483728, | |
| "step": 20000 | |
| }, | |
| { | |
| "loss": 3.6133453249931337e-06, | |
| "grad_norm": 0.0002495869412086904, | |
| "learning_rate": 9.40954556357535e-06, | |
| "epoch": 8.055443953394938, | |
| "step": 20050 | |
| }, | |
| { | |
| "loss": 3.3559650182724e-06, | |
| "grad_norm": 0.00026279842131771147, | |
| "learning_rate": 9.222355859534071e-06, | |
| "epoch": 8.075532342306147, | |
| "step": 20100 | |
| }, | |
| { | |
| "loss": 3.551878035068512e-06, | |
| "grad_norm": 0.0001303624449064955, | |
| "learning_rate": 9.036857518329356e-06, | |
| "epoch": 8.095620731217357, | |
| "step": 20150 | |
| }, | |
| { | |
| "loss": 3.4165382385253906e-06, | |
| "grad_norm": 0.00014572461077477783, | |
| "learning_rate": 8.853058234005512e-06, | |
| "epoch": 8.115709120128566, | |
| "step": 20200 | |
| }, | |
| { | |
| "loss": 0.0004174730554223061, | |
| "grad_norm": 0.6496160626411438, | |
| "learning_rate": 8.670965630133893e-06, | |
| "epoch": 8.135797509039776, | |
| "step": 20250 | |
| }, | |
| { | |
| "loss": 6.2954053282737735e-06, | |
| "grad_norm": 0.0005189924850128591, | |
| "learning_rate": 8.490587259496635e-06, | |
| "epoch": 8.155885897950984, | |
| "step": 20300 | |
| }, | |
| { | |
| "loss": 0.00034780647605657576, | |
| "grad_norm": 0.00014101318083703518, | |
| "learning_rate": 8.311930603773438e-06, | |
| "epoch": 8.175974286862195, | |
| "step": 20350 | |
| }, | |
| { | |
| "loss": 9.302161633968354e-06, | |
| "grad_norm": 0.00019721974967978895, | |
| "learning_rate": 8.135003073231246e-06, | |
| "epoch": 8.196062675773403, | |
| "step": 20400 | |
| }, | |
| { | |
| "loss": 1.5042945742607116e-05, | |
| "grad_norm": 0.00016112760931719095, | |
| "learning_rate": 7.959812006416861e-06, | |
| "epoch": 8.216151064684611, | |
| "step": 20450 | |
| }, | |
| { | |
| "loss": 3.8015469908714295e-06, | |
| "grad_norm": 0.0003184220695402473, | |
| "learning_rate": 7.78636466985257e-06, | |
| "epoch": 8.236239453595822, | |
| "step": 20500 | |
| }, | |
| { | |
| "eval_seen_loss": 0.012019069865345955, | |
| "eval_seen_accuracy": 0.9978864734299517, | |
| "eval_seen_f1_valid": 0.9983498349834984, | |
| "eval_seen_f1_invalid": 0.9970612930310664, | |
| "eval_seen_macro_f1": 0.9977055640072824, | |
| "eval_seen_majority_baseline": 0.6400966183574879, | |
| "eval_seen_runtime": 0.3216, | |
| "eval_seen_samples_per_second": 20600.148, | |
| "eval_seen_steps_per_second": 161.716, | |
| "epoch": 8.236239453595822, | |
| "step": 20500 | |
| }, | |
| { | |
| "eval_unseen_loss": 0.03911798819899559, | |
| "eval_unseen_accuracy": 0.9945652173913043, | |
| "eval_unseen_f1_valid": 0.9957627118644068, | |
| "eval_unseen_f1_invalid": 0.9924242424242424, | |
| "eval_unseen_macro_f1": 0.9940934771443246, | |
| "eval_unseen_majority_baseline": 0.6400966183574879, | |
| "eval_unseen_runtime": 0.3311, | |
| "eval_unseen_samples_per_second": 20004.327, | |
| "eval_unseen_steps_per_second": 157.039, | |
| "epoch": 8.236239453595822, | |
| "step": 20500 | |
| }, | |
| { | |
| "loss": 4.818551242351532e-06, | |
| "grad_norm": 0.00016147899441421032, | |
| "learning_rate": 7.614668257734719e-06, | |
| "epoch": 8.25632784250703, | |
| "step": 20550 | |
| }, | |
| { | |
| "loss": 7.018953561782837e-05, | |
| "grad_norm": 0.00044564157724380493, | |
| "learning_rate": 7.444729891635349e-06, | |
| "epoch": 8.27641623141824, | |
| "step": 20600 | |
| }, | |
| { | |
| "loss": 3.513358533382416e-06, | |
| "grad_norm": 0.00014842434029560536, | |
| "learning_rate": 7.2765566202068206e-06, | |
| "epoch": 8.296504620329449, | |
| "step": 20650 | |
| }, | |
| { | |
| "loss": 3.3337250351905822e-06, | |
| "grad_norm": 0.00013708991173189133, | |
| "learning_rate": 7.110155418889419e-06, | |
| "epoch": 8.316593009240659, | |
| "step": 20700 | |
| }, | |
| { | |
| "loss": 1.0120011866092682e-05, | |
| "grad_norm": 0.0001332744723185897, | |
| "learning_rate": 6.945533189622022e-06, | |
| "epoch": 8.336681398151867, | |
| "step": 20750 | |
| }, | |
| { | |
| "loss": 3.4270063042640684e-06, | |
| "grad_norm": 0.00013819074956700206, | |
| "learning_rate": 6.7826967605558344e-06, | |
| "epoch": 8.356769787063078, | |
| "step": 20800 | |
| }, | |
| { | |
| "loss": 1.0085813701152801e-05, | |
| "grad_norm": 0.00014096000813879073, | |
| "learning_rate": 6.621652885771229e-06, | |
| "epoch": 8.376858175974286, | |
| "step": 20850 | |
| }, | |
| { | |
| "loss": 3.064647316932678e-06, | |
| "grad_norm": 0.00014031221508048475, | |
| "learning_rate": 6.462408244997486e-06, | |
| "epoch": 8.396946564885496, | |
| "step": 20900 | |
| }, | |
| { | |
| "loss": 3.0971691012382507e-06, | |
| "grad_norm": 0.00013209764438215643, | |
| "learning_rate": 6.304969443335862e-06, | |
| "epoch": 8.417034953796705, | |
| "step": 20950 | |
| }, | |
| { | |
| "loss": 3.0650943517684936e-06, | |
| "grad_norm": 0.00014701248437631875, | |
| "learning_rate": 6.149343010985503e-06, | |
| "epoch": 8.437123342707915, | |
| "step": 21000 | |
| }, | |
| { | |
| "eval_seen_loss": 0.012507510371506214, | |
| "eval_seen_accuracy": 0.9981884057971014, | |
| "eval_seen_f1_valid": 0.9985859061984445, | |
| "eval_seen_f1_invalid": 0.997480050398992, | |
| "eval_seen_macro_f1": 0.9980329782987183, | |
| "eval_seen_majority_baseline": 0.6400966183574879, | |
| "eval_seen_runtime": 0.3268, | |
| "eval_seen_samples_per_second": 20271.593, | |
| "eval_seen_steps_per_second": 159.137, | |
| "epoch": 8.437123342707915, | |
| "step": 21000 | |
| }, | |
| { | |
| "eval_unseen_loss": 0.03895845264196396, | |
| "eval_unseen_accuracy": 0.9942632850241546, | |
| "eval_unseen_f1_valid": 0.9955283596140269, | |
| "eval_unseen_f1_invalid": 0.992, | |
| "eval_unseen_macro_f1": 0.9937641798070134, | |
| "eval_unseen_majority_baseline": 0.6400966183574879, | |
| "eval_unseen_runtime": 0.3107, | |
| "eval_unseen_samples_per_second": 21317.822, | |
| "eval_unseen_steps_per_second": 167.35, | |
| "epoch": 8.437123342707915, | |
| "step": 21000 | |
| }, | |
| { | |
| "loss": 3.073066473007202e-06, | |
| "grad_norm": 0.00013140306691639125, | |
| "learning_rate": 5.995535402972702e-06, | |
| "epoch": 8.457211731619124, | |
| "step": 21050 | |
| }, | |
| { | |
| "loss": 4.372160881757736e-05, | |
| "grad_norm": 0.00014569831546396017, | |
| "learning_rate": 5.843552998883073e-06, | |
| "epoch": 8.477300120530334, | |
| "step": 21100 | |
| }, | |
| { | |
| "loss": 3.0318647623062134e-06, | |
| "grad_norm": 0.00016386796778533608, | |
| "learning_rate": 5.693402102596962e-06, | |
| "epoch": 8.497388509441542, | |
| "step": 21150 | |
| }, | |
| { | |
| "loss": 4.044137895107269e-06, | |
| "grad_norm": 0.0001544577971799299, | |
| "learning_rate": 5.545088942028009e-06, | |
| "epoch": 8.517476898352752, | |
| "step": 21200 | |
| }, | |
| { | |
| "loss": 3.307312726974487e-06, | |
| "grad_norm": 0.0002282865607412532, | |
| "learning_rate": 5.398619668864818e-06, | |
| "epoch": 8.537565287263961, | |
| "step": 21250 | |
| }, | |
| { | |
| "loss": 3.1630322337150576e-06, | |
| "grad_norm": 0.00012746526044793427, | |
| "learning_rate": 5.2540003583157525e-06, | |
| "epoch": 8.557653676175171, | |
| "step": 21300 | |
| }, | |
| { | |
| "loss": 2.9011070728302e-06, | |
| "grad_norm": 0.00010656457743607461, | |
| "learning_rate": 5.111237008856984e-06, | |
| "epoch": 8.57774206508638, | |
| "step": 21350 | |
| }, | |
| { | |
| "loss": 3.054514527320862e-06, | |
| "grad_norm": 0.00010875113366637379, | |
| "learning_rate": 4.970335541983723e-06, | |
| "epoch": 8.59783045399759, | |
| "step": 21400 | |
| }, | |
| { | |
| "loss": 3.0556321144104004e-06, | |
| "grad_norm": 0.0001811092661228031, | |
| "learning_rate": 4.831301801964555e-06, | |
| "epoch": 8.617918842908798, | |
| "step": 21450 | |
| }, | |
| { | |
| "loss": 3.187432885169983e-06, | |
| "grad_norm": 0.00012966326903551817, | |
| "learning_rate": 4.694141555599058e-06, | |
| "epoch": 8.638007231820009, | |
| "step": 21500 | |
| }, | |
| { | |
| "eval_seen_loss": 0.012946849688887596, | |
| "eval_seen_accuracy": 0.9981884057971014, | |
| "eval_seen_f1_valid": 0.9985859061984445, | |
| "eval_seen_f1_invalid": 0.997480050398992, | |
| "eval_seen_macro_f1": 0.9980329782987183, | |
| "eval_seen_majority_baseline": 0.6400966183574879, | |
| "eval_seen_runtime": 0.3132, | |
| "eval_seen_samples_per_second": 21146.93, | |
| "eval_seen_steps_per_second": 166.009, | |
| "epoch": 8.638007231820009, | |
| "step": 21500 | |
| }, | |
| { | |
| "eval_unseen_loss": 0.04752921685576439, | |
| "eval_unseen_accuracy": 0.9930555555555556, | |
| "eval_unseen_f1_valid": 0.9945920526687044, | |
| "eval_unseen_f1_invalid": 0.9902994517081402, | |
| "eval_unseen_macro_f1": 0.9924457521884222, | |
| "eval_unseen_majority_baseline": 0.6400966183574879, | |
| "eval_unseen_runtime": 0.3071, | |
| "eval_unseen_samples_per_second": 21566.403, | |
| "eval_unseen_steps_per_second": 169.301, | |
| "epoch": 8.638007231820009, | |
| "step": 21500 | |
| }, | |
| { | |
| "loss": 3.5515427589416504e-06, | |
| "grad_norm": 0.00013049629342276603, | |
| "learning_rate": 4.5588604919785895e-06, | |
| "epoch": 8.658095620731217, | |
| "step": 21550 | |
| }, | |
| { | |
| "loss": 2.780258655548096e-06, | |
| "grad_norm": 0.0001262566656805575, | |
| "learning_rate": 4.425464222250348e-06, | |
| "epoch": 8.678184009642427, | |
| "step": 21600 | |
| }, | |
| { | |
| "loss": 4.116110503673554e-06, | |
| "grad_norm": 0.000128673724248074, | |
| "learning_rate": 4.293958279384608e-06, | |
| "epoch": 8.698272398553636, | |
| "step": 21650 | |
| }, | |
| { | |
| "loss": 8.174490183591842e-05, | |
| "grad_norm": 0.0005245626671239734, | |
| "learning_rate": 4.16434811794526e-06, | |
| "epoch": 8.718360787464846, | |
| "step": 21700 | |
| }, | |
| { | |
| "loss": 7.002241909503937e-06, | |
| "grad_norm": 0.00013448468234855682, | |
| "learning_rate": 4.036639113863522e-06, | |
| "epoch": 8.738449176376054, | |
| "step": 21750 | |
| }, | |
| { | |
| "loss": 2.822093665599823e-06, | |
| "grad_norm": 0.00012475447147153318, | |
| "learning_rate": 3.910836564214965e-06, | |
| "epoch": 8.758537565287265, | |
| "step": 21800 | |
| }, | |
| { | |
| "loss": 2.5692582130432127e-06, | |
| "grad_norm": 0.00011487610754556954, | |
| "learning_rate": 3.7869456869998597e-06, | |
| "epoch": 8.778625954198473, | |
| "step": 21850 | |
| }, | |
| { | |
| "loss": 2.6272982358932495e-06, | |
| "grad_norm": 0.00014223760808818042, | |
| "learning_rate": 3.664971620926666e-06, | |
| "epoch": 8.798714343109683, | |
| "step": 21900 | |
| }, | |
| { | |
| "loss": 2.6938319206237793e-06, | |
| "grad_norm": 0.00010725839820224792, | |
| "learning_rate": 3.5449194251989505e-06, | |
| "epoch": 8.818802732020892, | |
| "step": 21950 | |
| }, | |
| { | |
| "loss": 1.2151449918746949e-05, | |
| "grad_norm": 0.0001417612365912646, | |
| "learning_rate": 3.4267940793055063e-06, | |
| "epoch": 8.838891120932102, | |
| "step": 22000 | |
| }, | |
| { | |
| "eval_seen_loss": 0.012583291158080101, | |
| "eval_seen_accuracy": 0.9980374396135265, | |
| "eval_seen_f1_valid": 0.9984678845020625, | |
| "eval_seen_f1_invalid": 0.9972706277556163, | |
| "eval_seen_macro_f1": 0.9978692561288394, | |
| "eval_seen_majority_baseline": 0.6400966183574879, | |
| "eval_seen_runtime": 0.3161, | |
| "eval_seen_samples_per_second": 20954.738, | |
| "eval_seen_steps_per_second": 164.5, | |
| "epoch": 8.838891120932102, | |
| "step": 22000 | |
| }, | |
| { | |
| "eval_unseen_loss": 0.04813293740153313, | |
| "eval_unseen_accuracy": 0.9936594202898551, | |
| "eval_unseen_f1_valid": 0.9950599858856739, | |
| "eval_unseen_f1_invalid": 0.9911504424778761, | |
| "eval_unseen_macro_f1": 0.993105214181775, | |
| "eval_unseen_majority_baseline": 0.6400966183574879, | |
| "eval_unseen_runtime": 0.3177, | |
| "eval_unseen_samples_per_second": 20849.332, | |
| "eval_unseen_steps_per_second": 163.672, | |
| "epoch": 8.838891120932102, | |
| "step": 22000 | |
| }, | |
| { | |
| "loss": 6.3090398907661436e-06, | |
| "grad_norm": 0.00020181726722512394, | |
| "learning_rate": 3.3106004828138525e-06, | |
| "epoch": 8.85897950984331, | |
| "step": 22050 | |
| }, | |
| { | |
| "loss": 2.9055774211883546e-06, | |
| "grad_norm": 0.00015510858793277293, | |
| "learning_rate": 3.19634345516695e-06, | |
| "epoch": 8.87906789875452, | |
| "step": 22100 | |
| }, | |
| { | |
| "loss": 2.4076923727989195e-06, | |
| "grad_norm": 0.00020350102568045259, | |
| "learning_rate": 3.0840277354833856e-06, | |
| "epoch": 8.899156287665729, | |
| "step": 22150 | |
| }, | |
| { | |
| "loss": 2.4836510419845583e-06, | |
| "grad_norm": 0.00012597607565112412, | |
| "learning_rate": 2.9736579823607224e-06, | |
| "epoch": 8.91924467657694, | |
| "step": 22200 | |
| }, | |
| { | |
| "loss": 2.3871287703514098e-06, | |
| "grad_norm": 0.00016495909949298948, | |
| "learning_rate": 2.8652387736823385e-06, | |
| "epoch": 8.939333065488148, | |
| "step": 22250 | |
| }, | |
| { | |
| "loss": 4.006139934062958e-06, | |
| "grad_norm": 0.0001801540347514674, | |
| "learning_rate": 2.758774606427489e-06, | |
| "epoch": 8.959421454399358, | |
| "step": 22300 | |
| }, | |
| { | |
| "loss": 4.346966743469239e-06, | |
| "grad_norm": 0.00020672632672358304, | |
| "learning_rate": 2.6542698964848232e-06, | |
| "epoch": 8.979509843310566, | |
| "step": 22350 | |
| }, | |
| { | |
| "loss": 2.60915607213974e-06, | |
| "grad_norm": 0.000188817095477134, | |
| "learning_rate": 2.55172897846922e-06, | |
| "epoch": 8.999598232221775, | |
| "step": 22400 | |
| }, | |
| { | |
| "loss": 2.6184692978858947e-06, | |
| "grad_norm": 0.0001020833442453295, | |
| "learning_rate": 2.45115610554198e-06, | |
| "epoch": 9.019686621132985, | |
| "step": 22450 | |
| }, | |
| { | |
| "loss": 3.1993165612220762e-06, | |
| "grad_norm": 0.00011981981515418738, | |
| "learning_rate": 2.3525554492344115e-06, | |
| "epoch": 9.039775010044194, | |
| "step": 22500 | |
| }, | |
| { | |
| "eval_seen_loss": 0.012907730415463448, | |
| "eval_seen_accuracy": 0.9980374396135265, | |
| "eval_seen_f1_valid": 0.9984678845020625, | |
| "eval_seen_f1_invalid": 0.9972706277556163, | |
| "eval_seen_macro_f1": 0.9978692561288394, | |
| "eval_seen_majority_baseline": 0.6400966183574879, | |
| "eval_seen_runtime": 0.3224, | |
| "eval_seen_samples_per_second": 20544.851, | |
| "eval_seen_steps_per_second": 161.282, | |
| "epoch": 9.039775010044194, | |
| "step": 22500 | |
| }, | |
| { | |
| "eval_unseen_loss": 0.048420634120702744, | |
| "eval_unseen_accuracy": 0.9935084541062802, | |
| "eval_unseen_f1_valid": 0.9949429613077737, | |
| "eval_unseen_f1_invalid": 0.9909378292939937, | |
| "eval_unseen_macro_f1": 0.9929403953008837, | |
| "eval_unseen_majority_baseline": 0.6400966183574879, | |
| "eval_unseen_runtime": 0.3203, | |
| "eval_unseen_samples_per_second": 20678.404, | |
| "eval_unseen_steps_per_second": 162.33, | |
| "epoch": 9.039775010044194, | |
| "step": 22500 | |
| }, | |
| { | |
| "loss": 3.539063036441803e-06, | |
| "grad_norm": 0.00010783238394651562, | |
| "learning_rate": 2.255931099274838e-06, | |
| "epoch": 9.059863398955404, | |
| "step": 22550 | |
| }, | |
| { | |
| "loss": 5.3878501057624816e-06, | |
| "grad_norm": 0.0001741989835863933, | |
| "learning_rate": 2.161287063418921e-06, | |
| "epoch": 9.079951787866612, | |
| "step": 22600 | |
| }, | |
| { | |
| "loss": 6.289780139923096e-06, | |
| "grad_norm": 0.0006154667935334146, | |
| "learning_rate": 2.068627267283463e-06, | |
| "epoch": 9.100040176777823, | |
| "step": 22650 | |
| }, | |
| { | |
| "loss": 2.5946274399757386e-06, | |
| "grad_norm": 0.0003669976722449064, | |
| "learning_rate": 1.9779555541835803e-06, | |
| "epoch": 9.120128565689031, | |
| "step": 22700 | |
| }, | |
| { | |
| "loss": 2.5730207562446596e-06, | |
| "grad_norm": 0.0001609391183592379, | |
| "learning_rate": 1.8892756849732628e-06, | |
| "epoch": 9.140216954600241, | |
| "step": 22750 | |
| }, | |
| { | |
| "loss": 5.313083529472351e-06, | |
| "grad_norm": 0.0004570932942442596, | |
| "learning_rate": 1.8025913378893921e-06, | |
| "epoch": 9.16030534351145, | |
| "step": 22800 | |
| }, | |
| { | |
| "loss": 2.6881694793701173e-06, | |
| "grad_norm": 0.00011044947314076126, | |
| "learning_rate": 1.7179061083992143e-06, | |
| "epoch": 9.18039373242266, | |
| "step": 22850 | |
| }, | |
| { | |
| "loss": 6.092563271522522e-06, | |
| "grad_norm": 0.00014000650844536722, | |
| "learning_rate": 1.6352235090511482e-06, | |
| "epoch": 9.200482121333868, | |
| "step": 22900 | |
| }, | |
| { | |
| "loss": 2.402588725090027e-06, | |
| "grad_norm": 0.00012029660138068721, | |
| "learning_rate": 1.5545469693291404e-06, | |
| "epoch": 9.220570510245079, | |
| "step": 22950 | |
| }, | |
| { | |
| "loss": 2.5689974427223206e-06, | |
| "grad_norm": 0.0001026357349473983, | |
| "learning_rate": 1.4758798355103964e-06, | |
| "epoch": 9.240658899156287, | |
| "step": 23000 | |
| }, | |
| { | |
| "eval_seen_loss": 0.012925754301249981, | |
| "eval_seen_accuracy": 0.9980374396135265, | |
| "eval_seen_f1_valid": 0.9984678845020625, | |
| "eval_seen_f1_invalid": 0.9972706277556163, | |
| "eval_seen_macro_f1": 0.9978692561288394, | |
| "eval_seen_majority_baseline": 0.6400966183574879, | |
| "eval_seen_runtime": 0.3111, | |
| "eval_seen_samples_per_second": 21289.562, | |
| "eval_seen_steps_per_second": 167.128, | |
| "epoch": 9.240658899156287, | |
| "step": 23000 | |
| }, | |
| { | |
| "eval_unseen_loss": 0.0486987829208374, | |
| "eval_unseen_accuracy": 0.9935084541062802, | |
| "eval_unseen_f1_valid": 0.9949429613077737, | |
| "eval_unseen_f1_invalid": 0.9909378292939937, | |
| "eval_unseen_macro_f1": 0.9929403953008837, | |
| "eval_unseen_majority_baseline": 0.6400966183574879, | |
| "eval_unseen_runtime": 0.3047, | |
| "eval_unseen_samples_per_second": 21736.906, | |
| "eval_unseen_steps_per_second": 170.64, | |
| "epoch": 9.240658899156287, | |
| "step": 23000 | |
| }, | |
| { | |
| "loss": 7.318779826164245e-06, | |
| "grad_norm": 9.652505832491443e-05, | |
| "learning_rate": 1.3992253705265913e-06, | |
| "epoch": 9.260747288067497, | |
| "step": 23050 | |
| }, | |
| { | |
| "loss": 1.061670482158661e-05, | |
| "grad_norm": 0.00011741998605430126, | |
| "learning_rate": 1.3245867538285218e-06, | |
| "epoch": 9.280835676978706, | |
| "step": 23100 | |
| }, | |
| { | |
| "loss": 2.544894814491272e-06, | |
| "grad_norm": 0.00011236020509386435, | |
| "learning_rate": 1.2519670812542462e-06, | |
| "epoch": 9.300924065889916, | |
| "step": 23150 | |
| }, | |
| { | |
| "loss": 2.25018709897995e-06, | |
| "grad_norm": 0.00014098426618147641, | |
| "learning_rate": 1.181369364900653e-06, | |
| "epoch": 9.321012454801124, | |
| "step": 23200 | |
| }, | |
| { | |
| "loss": 2.422593533992767e-06, | |
| "grad_norm": 0.0002591471129562706, | |
| "learning_rate": 1.1127965329985613e-06, | |
| "epoch": 9.341100843712335, | |
| "step": 23250 | |
| }, | |
| { | |
| "loss": 4.821904003620147e-06, | |
| "grad_norm": 0.00010918612679233775, | |
| "learning_rate": 1.046251429791223e-06, | |
| "epoch": 9.361189232623543, | |
| "step": 23300 | |
| }, | |
| { | |
| "loss": 2.5689974427223206e-06, | |
| "grad_norm": 9.60305769694969e-05, | |
| "learning_rate": 9.817368154163731e-07, | |
| "epoch": 9.381277621534753, | |
| "step": 23350 | |
| }, | |
| { | |
| "loss": 2.3266300559043883e-06, | |
| "grad_norm": 0.00010005357034970075, | |
| "learning_rate": 9.192553657917491e-07, | |
| "epoch": 9.401366010445962, | |
| "step": 23400 | |
| }, | |
| { | |
| "loss": 2.2694468498229982e-06, | |
| "grad_norm": 0.00019680566038005054, | |
| "learning_rate": 8.588096725041017e-07, | |
| "epoch": 9.421454399357172, | |
| "step": 23450 | |
| }, | |
| { | |
| "loss": 2.3963674902915954e-06, | |
| "grad_norm": 0.00012088896619388834, | |
| "learning_rate": 8.004022427016755e-07, | |
| "epoch": 9.44154278826838, | |
| "step": 23500 | |
| }, | |
| { | |
| "eval_seen_loss": 0.01295688096433878, | |
| "eval_seen_accuracy": 0.9980374396135265, | |
| "eval_seen_f1_valid": 0.9984678845020625, | |
| "eval_seen_f1_invalid": 0.9972706277556163, | |
| "eval_seen_macro_f1": 0.9978692561288394, | |
| "eval_seen_majority_baseline": 0.6400966183574879, | |
| "eval_seen_runtime": 0.3169, | |
| "eval_seen_samples_per_second": 20904.426, | |
| "eval_seen_steps_per_second": 164.105, | |
| "epoch": 9.44154278826838, | |
| "step": 23500 | |
| }, | |
| { | |
| "eval_unseen_loss": 0.04889357462525368, | |
| "eval_unseen_accuracy": 0.9935084541062802, | |
| "eval_unseen_f1_valid": 0.9949429613077737, | |
| "eval_unseen_f1_invalid": 0.9909378292939937, | |
| "eval_unseen_macro_f1": 0.9929403953008837, | |
| "eval_unseen_majority_baseline": 0.6400966183574879, | |
| "eval_unseen_runtime": 0.3124, | |
| "eval_unseen_samples_per_second": 21200.326, | |
| "eval_unseen_steps_per_second": 166.428, | |
| "epoch": 9.44154278826838, | |
| "step": 23500 | |
| }, | |
| { | |
| "loss": 2.274066209793091e-06, | |
| "grad_norm": 0.00013658883108291775, | |
| "learning_rate": 7.440354989902476e-07, | |
| "epoch": 9.46163117717959, | |
| "step": 23550 | |
| }, | |
| { | |
| "loss": 2.394132316112518e-06, | |
| "grad_norm": 9.553777636028826e-05, | |
| "learning_rate": 6.897117793326246e-07, | |
| "epoch": 9.4817195660908, | |
| "step": 23600 | |
| }, | |
| { | |
| "loss": 2.231821417808533e-06, | |
| "grad_norm": 9.738129301695153e-05, | |
| "learning_rate": 6.374333369516816e-07, | |
| "epoch": 9.50180795500201, | |
| "step": 23650 | |
| }, | |
| { | |
| "loss": 2.571381628513336e-06, | |
| "grad_norm": 0.00044456496834754944, | |
| "learning_rate": 5.872023402369086e-07, | |
| "epoch": 9.521896343913218, | |
| "step": 23700 | |
| }, | |
| { | |
| "loss": 9.307749569416047e-06, | |
| "grad_norm": 0.00010363019828218967, | |
| "learning_rate": 5.390208726544388e-07, | |
| "epoch": 9.541984732824428, | |
| "step": 23750 | |
| }, | |
| { | |
| "loss": 2.765655517578125e-06, | |
| "grad_norm": 0.0001128022704506293, | |
| "learning_rate": 4.928909326606779e-07, | |
| "epoch": 9.562073121735637, | |
| "step": 23800 | |
| }, | |
| { | |
| "loss": 4.050321877002716e-06, | |
| "grad_norm": 0.00010679530532797799, | |
| "learning_rate": 4.4881443361936557e-07, | |
| "epoch": 9.582161510646847, | |
| "step": 23850 | |
| }, | |
| { | |
| "loss": 2.3236870765686035e-06, | |
| "grad_norm": 0.00013532352750189602, | |
| "learning_rate": 4.0679320372226105e-07, | |
| "epoch": 9.602249899558055, | |
| "step": 23900 | |
| }, | |
| { | |
| "loss": 2.273358404636383e-06, | |
| "grad_norm": 0.00011449832527432591, | |
| "learning_rate": 3.668289859132701e-07, | |
| "epoch": 9.622338288469265, | |
| "step": 23950 | |
| }, | |
| { | |
| "loss": 2.487748861312866e-06, | |
| "grad_norm": 0.00010196401854045689, | |
| "learning_rate": 3.289234378161754e-07, | |
| "epoch": 9.642426677380474, | |
| "step": 24000 | |
| }, | |
| { | |
| "eval_seen_loss": 0.012985438108444214, | |
| "eval_seen_accuracy": 0.9980374396135265, | |
| "eval_seen_f1_valid": 0.9984678845020625, | |
| "eval_seen_f1_invalid": 0.9972706277556163, | |
| "eval_seen_macro_f1": 0.9978692561288394, | |
| "eval_seen_majority_baseline": 0.6400966183574879, | |
| "eval_seen_runtime": 0.315, | |
| "eval_seen_samples_per_second": 21031.688, | |
| "eval_seen_steps_per_second": 165.104, | |
| "epoch": 9.642426677380474, | |
| "step": 24000 | |
| }, | |
| { | |
| "eval_unseen_loss": 0.049161944538354874, | |
| "eval_unseen_accuracy": 0.9935084541062802, | |
| "eval_unseen_f1_valid": 0.9949429613077737, | |
| "eval_unseen_f1_invalid": 0.9909378292939937, | |
| "eval_unseen_macro_f1": 0.9929403953008837, | |
| "eval_unseen_majority_baseline": 0.6400966183574879, | |
| "eval_unseen_runtime": 0.3049, | |
| "eval_unseen_samples_per_second": 21728.287, | |
| "eval_unseen_steps_per_second": 170.572, | |
| "epoch": 9.642426677380474, | |
| "step": 24000 | |
| }, | |
| { | |
| "loss": 2.380460500717163e-06, | |
| "grad_norm": 8.719210018170998e-05, | |
| "learning_rate": 2.9307813166588036e-07, | |
| "epoch": 9.662515066291684, | |
| "step": 24050 | |
| }, | |
| { | |
| "loss": 3.890357911586761e-06, | |
| "grad_norm": 0.00022959259513299912, | |
| "learning_rate": 2.592945542431946e-07, | |
| "epoch": 9.682603455202893, | |
| "step": 24100 | |
| }, | |
| { | |
| "loss": 2.6455894112586974e-06, | |
| "grad_norm": 0.0001019965493469499, | |
| "learning_rate": 2.2757410681315537e-07, | |
| "epoch": 9.702691844114103, | |
| "step": 24150 | |
| }, | |
| { | |
| "loss": 2.2900477051734925e-06, | |
| "grad_norm": 0.00013137496716808528, | |
| "learning_rate": 1.9791810506693542e-07, | |
| "epoch": 9.722780233025311, | |
| "step": 24200 | |
| }, | |
| { | |
| "loss": 2.7436017990112305e-06, | |
| "grad_norm": 9.810757910599932e-05, | |
| "learning_rate": 1.7032777906723087e-07, | |
| "epoch": 9.742868621936521, | |
| "step": 24250 | |
| }, | |
| { | |
| "loss": 2.2519752383232116e-06, | |
| "grad_norm": 0.00012141554907429963, | |
| "learning_rate": 1.4480427319726875e-07, | |
| "epoch": 9.76295701084773, | |
| "step": 24300 | |
| }, | |
| { | |
| "loss": 2.942308783531189e-06, | |
| "grad_norm": 0.00010106329864356667, | |
| "learning_rate": 1.2134864611333952e-07, | |
| "epoch": 9.78304539975894, | |
| "step": 24350 | |
| }, | |
| { | |
| "loss": 4.490092396736145e-06, | |
| "grad_norm": 0.000193135958397761, | |
| "learning_rate": 9.996187070087648e-08, | |
| "epoch": 9.803133788670149, | |
| "step": 24400 | |
| }, | |
| { | |
| "loss": 2.4335458874702454e-06, | |
| "grad_norm": 0.0001166210204246454, | |
| "learning_rate": 8.064483403410483e-08, | |
| "epoch": 9.823222177581357, | |
| "step": 24450 | |
| }, | |
| { | |
| "loss": 2.541393041610718e-06, | |
| "grad_norm": 8.921896369429305e-05, | |
| "learning_rate": 6.339833733924327e-08, | |
| "epoch": 9.843310566492567, | |
| "step": 24500 | |
| }, | |
| { | |
| "eval_seen_loss": 0.013017052784562111, | |
| "eval_seen_accuracy": 0.9980374396135265, | |
| "eval_seen_f1_valid": 0.9984678845020625, | |
| "eval_seen_f1_invalid": 0.9972706277556163, | |
| "eval_seen_macro_f1": 0.9978692561288394, | |
| "eval_seen_majority_baseline": 0.6400966183574879, | |
| "eval_seen_runtime": 0.3165, | |
| "eval_seen_samples_per_second": 20925.887, | |
| "eval_seen_steps_per_second": 164.273, | |
| "epoch": 9.843310566492567, | |
| "step": 24500 | |
| }, | |
| { | |
| "eval_unseen_loss": 0.04933434724807739, | |
| "eval_unseen_accuracy": 0.9935084541062802, | |
| "eval_unseen_f1_valid": 0.9949429613077737, | |
| "eval_unseen_f1_invalid": 0.9909378292939937, | |
| "eval_unseen_macro_f1": 0.9929403953008837, | |
| "eval_unseen_majority_baseline": 0.6400966183574879, | |
| "eval_unseen_runtime": 0.3035, | |
| "eval_unseen_samples_per_second": 21822.375, | |
| "eval_unseen_steps_per_second": 171.311, | |
| "epoch": 9.843310566492567, | |
| "step": 24500 | |
| }, | |
| { | |
| "loss": 2.145916223526001e-06, | |
| "grad_norm": 9.508332004770637e-05, | |
| "learning_rate": 4.8223095961297257e-08, | |
| "epoch": 9.863398955403778, | |
| "step": 24550 | |
| }, | |
| { | |
| "loss": 2.3793429136276247e-06, | |
| "grad_norm": 0.00017216239939443767, | |
| "learning_rate": 3.511973933434942e-08, | |
| "epoch": 9.883487344314986, | |
| "step": 24600 | |
| }, | |
| { | |
| "loss": 3.3716857433319093e-06, | |
| "grad_norm": 0.00010370145901106298, | |
| "learning_rate": 2.4088810955474883e-08, | |
| "epoch": 9.903575733226194, | |
| "step": 24650 | |
| }, | |
| { | |
| "loss": 2.418123185634613e-06, | |
| "grad_norm": 0.00010311349615221843, | |
| "learning_rate": 1.513076836220373e-08, | |
| "epoch": 9.923664122137405, | |
| "step": 24700 | |
| }, | |
| { | |
| "loss": 2.4419650435447693e-06, | |
| "grad_norm": 9.561217302689329e-05, | |
| "learning_rate": 8.24598311352509e-09, | |
| "epoch": 9.943752511048613, | |
| "step": 24750 | |
| }, | |
| { | |
| "loss": 2.808086574077606e-06, | |
| "grad_norm": 0.00010774183465400711, | |
| "learning_rate": 3.434740774482803e-09, | |
| "epoch": 9.963840899959823, | |
| "step": 24800 | |
| }, | |
| { | |
| "loss": 4.667192697525024e-06, | |
| "grad_norm": 9.36409633141011e-05, | |
| "learning_rate": 6.972409043404238e-10, | |
| "epoch": 9.983929288871032, | |
| "step": 24850 | |
| }, | |
| { | |
| "eval_seen_loss": 0.013024607673287392, | |
| "eval_seen_accuracy": 0.9980374396135265, | |
| "eval_seen_f1_valid": 0.9984678845020625, | |
| "eval_seen_f1_invalid": 0.9972706277556163, | |
| "eval_seen_macro_f1": 0.9978692561288394, | |
| "eval_seen_majority_baseline": 0.6400966183574879, | |
| "eval_seen_runtime": 0.3177, | |
| "eval_seen_samples_per_second": 20853.119, | |
| "eval_seen_steps_per_second": 163.702, | |
| "epoch": 10.0, | |
| "step": 24890 | |
| }, | |
| { | |
| "eval_unseen_loss": 0.0492788590490818, | |
| "eval_unseen_accuracy": 0.9935084541062802, | |
| "eval_unseen_f1_valid": 0.9949429613077737, | |
| "eval_unseen_f1_invalid": 0.9909378292939937, | |
| "eval_unseen_macro_f1": 0.9929403953008837, | |
| "eval_unseen_majority_baseline": 0.6400966183574879, | |
| "eval_unseen_runtime": 0.3068, | |
| "eval_unseen_samples_per_second": 21589.715, | |
| "eval_unseen_steps_per_second": 169.484, | |
| "epoch": 10.0, | |
| "step": 24890 | |
| }, | |
| { | |
| "train_runtime": 222.8072, | |
| "train_samples_per_second": 7146.985, | |
| "train_steps_per_second": 111.711, | |
| "total_flos": 1015596244174848.0, | |
| "train_loss": 0.01661168186644346, | |
| "epoch": 10.0, | |
| "step": 24890 | |
| }, | |
| { | |
| "eval_seen_loss": 0.011836923658847809, | |
| "eval_seen_accuracy": 0.9978864734299517, | |
| "eval_seen_f1_valid": 0.9983498349834984, | |
| "eval_seen_f1_invalid": 0.9970612930310664, | |
| "eval_seen_macro_f1": 0.9977055640072824, | |
| "eval_seen_majority_baseline": 0.6400966183574879, | |
| "eval_seen_runtime": 0.3194, | |
| "eval_seen_samples_per_second": 20735.801, | |
| "eval_seen_steps_per_second": 162.781, | |
| "epoch": 10.0, | |
| "step": 24890 | |
| }, | |
| { | |
| "eval_unseen_loss": 0.04228868708014488, | |
| "eval_unseen_accuracy": 0.9947161835748792, | |
| "eval_unseen_f1_valid": 0.9958808991408732, | |
| "eval_unseen_f1_invalid": 0.9926331298673964, | |
| "eval_unseen_macro_f1": 0.9942570145041347, | |
| "eval_unseen_majority_baseline": 0.6400966183574879, | |
| "eval_unseen_runtime": 0.3081, | |
| "eval_unseen_samples_per_second": 21497.784, | |
| "eval_unseen_steps_per_second": 168.763, | |
| "epoch": 10.0, | |
| "step": 24890 | |
| } | |
| ] | |
| } |