← all sources
application/jsonregistered
trainer_state.json
donto:blob/sha256/e1a363ebbe41115ebd9edce11f91be950007e7127978136c858bd5debe4d96faregistered 2026-07-16 · 0 facts extracted · 1 revisionExtracted facts (0)
No facts are anchored to this source yet.
Full text (7 KB)
{
"best_metric": 64.74793781248407,
"best_model_checkpoint": "/workspace/kuku-v24.5-balanced/output/model/checkpoint-112",
"epoch": 1.0,
"eval_steps": 56,
"global_step": 168,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.02976190476190476,
"grad_norm": 1.4015165567398071,
"learning_rate": 5.555555555555557e-06,
"loss": 0.6219,
"step": 5
},
{
"epoch": 0.05952380952380952,
"grad_norm": 1.0849660634994507,
"learning_rate": 9.937106918238994e-06,
"loss": 0.5912,
"step": 10
},
{
"epoch": 0.08928571428571429,
"grad_norm": 1.0773297548294067,
"learning_rate": 9.622641509433963e-06,
"loss": 0.4781,
"step": 15
},
{
"epoch": 0.11904761904761904,
"grad_norm": 1.2184337377548218,
"learning_rate": 9.308176100628931e-06,
"loss": 0.5528,
"step": 20
},
{
"epoch": 0.1488095238095238,
"grad_norm": 1.795865535736084,
"learning_rate": 8.9937106918239e-06,
"loss": 0.6429,
"step": 25
},
{
"epoch": 0.17857142857142858,
"grad_norm": 1.8272416591644287,
"learning_rate": 8.67924528301887e-06,
"loss": 0.6402,
"step": 30
},
{
"epoch": 0.20833333333333334,
"grad_norm": 1.3023637533187866,
"learning_rate": 8.364779874213837e-06,
"loss": 0.6204,
"step": 35
},
{
"epoch": 0.23809523809523808,
"grad_norm": 0.9808416962623596,
"learning_rate": 8.050314465408805e-06,
"loss": 0.6418,
"step": 40
},
{
"epoch": 0.26785714285714285,
"grad_norm": 1.135781168937683,
"learning_rate": 7.735849056603775e-06,
"loss": 0.4352,
"step": 45
},
{
"epoch": 0.2976190476190476,
"grad_norm": 1.102696418762207,
"learning_rate": 7.421383647798742e-06,
"loss": 0.6338,
"step": 50
},
{
"epoch": 0.3273809523809524,
"grad_norm": 1.048673152923584,
"learning_rate": 7.106918238993711e-06,
"loss": 0.61,
"step": 55
},
{
"epoch": 0.3333333333333333,
"eval_bleu": 38.20513196890358,
"eval_chrf": 64.66390632776844,
"eval_loss": 0.9421579241752625,
"eval_runtime": 38.9434,
"eval_samples_per_second": 3.544,
"eval_steps_per_second": 0.128,
"step": 56
},
{
"epoch": 0.35714285714285715,
"grad_norm": 0.8973528146743774,
"learning_rate": 6.792452830188679e-06,
"loss": 0.6052,
"step": 60
},
{
"epoch": 0.3869047619047619,
"grad_norm": 1.284206509590149,
"learning_rate": 6.477987421383648e-06,
"loss": 0.4759,
"step": 65
},
{
"epoch": 0.4166666666666667,
"grad_norm": 1.3126411437988281,
"learning_rate": 6.163522012578617e-06,
"loss": 0.7201,
"step": 70
},
{
"epoch": 0.44642857142857145,
"grad_norm": 1.4031754732131958,
"learning_rate": 5.849056603773585e-06,
"loss": 0.5985,
"step": 75
},
{
"epoch": 0.47619047619047616,
"grad_norm": 1.7022595405578613,
"learning_rate": 5.534591194968554e-06,
"loss": 0.5124,
"step": 80
},
{
"epoch": 0.5059523809523809,
"grad_norm": 1.0628783702850342,
"learning_rate": 5.220125786163523e-06,
"loss": 0.6287,
"step": 85
},
{
"epoch": 0.5357142857142857,
"grad_norm": 1.1832762956619263,
"learning_rate": 4.905660377358491e-06,
"loss": 0.5571,
"step": 90
},
{
"epoch": 0.5654761904761905,
"grad_norm": 1.055876612663269,
"learning_rate": 4.5911949685534595e-06,
"loss": 0.6938,
"step": 95
},
{
"epoch": 0.5952380952380952,
"grad_norm": 1.0038000345230103,
"learning_rate": 4.276729559748428e-06,
"loss": 0.6442,
"step": 100
},
{
"epoch": 0.625,
"grad_norm": 0.9879130721092224,
"learning_rate": 3.962264150943396e-06,
"loss": 0.6629,
"step": 105
},
{
"epoch": 0.6547619047619048,
"grad_norm": 1.3394246101379395,
"learning_rate": 3.647798742138365e-06,
"loss": 0.7636,
"step": 110
},
{
"epoch": 0.6666666666666666,
"eval_bleu": 38.082860130476696,
"eval_chrf": 64.74793781248407,
"eval_loss": 0.9404732584953308,
"eval_runtime": 37.6569,
"eval_samples_per_second": 3.665,
"eval_steps_per_second": 0.133,
"step": 112
},
{
"epoch": 0.6845238095238095,
"grad_norm": 1.0911802053451538,
"learning_rate": 3.3333333333333333e-06,
"loss": 0.6081,
"step": 115
},
{
"epoch": 0.7142857142857143,
"grad_norm": 1.1188783645629883,
"learning_rate": 3.018867924528302e-06,
"loss": 0.6441,
"step": 120
},
{
"epoch": 0.7440476190476191,
"grad_norm": 1.9945074319839478,
"learning_rate": 2.7044025157232706e-06,
"loss": 0.7241,
"step": 125
},
{
"epoch": 0.7738095238095238,
"grad_norm": 1.0721492767333984,
"learning_rate": 2.389937106918239e-06,
"loss": 0.6007,
"step": 130
},
{
"epoch": 0.8035714285714286,
"grad_norm": 1.460894227027893,
"learning_rate": 2.075471698113208e-06,
"loss": 0.6989,
"step": 135
},
{
"epoch": 0.8333333333333334,
"grad_norm": 1.2448103427886963,
"learning_rate": 1.7610062893081762e-06,
"loss": 0.601,
"step": 140
},
{
"epoch": 0.8630952380952381,
"grad_norm": 1.1157312393188477,
"learning_rate": 1.4465408805031447e-06,
"loss": 0.5828,
"step": 145
},
{
"epoch": 0.8928571428571429,
"grad_norm": 1.115433931350708,
"learning_rate": 1.1320754716981133e-06,
"loss": 0.6608,
"step": 150
},
{
"epoch": 0.9226190476190477,
"grad_norm": 1.113953709602356,
"learning_rate": 8.176100628930818e-07,
"loss": 0.6199,
"step": 155
},
{
"epoch": 0.9523809523809523,
"grad_norm": 1.1416937112808228,
"learning_rate": 5.031446540880503e-07,
"loss": 0.6954,
"step": 160
},
{
"epoch": 0.9821428571428571,
"grad_norm": 1.0764601230621338,
"learning_rate": 1.886792452830189e-07,
"loss": 0.6747,
"step": 165
},
{
"epoch": 1.0,
"eval_bleu": 38.074402371939556,
"eval_chrf": 64.70187813530163,
"eval_loss": 0.9395251274108887,
"eval_runtime": 43.0502,
"eval_samples_per_second": 3.206,
"eval_steps_per_second": 0.116,
"step": 168
}
],
"logging_steps": 5,
"max_steps": 168,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 56,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 2093226951290880.0,
"train_batch_size": 32,
"trial_name": null,
"trial_params": null
}