-
Evaluation command (Wikitext2):
# Evaluation command
python run_clm.py --model_name_or_path Cheng98/llama-39m \
--dataset_name wikitext \
--dataset_config_name wikitext-2-raw-v1 \
--block_size 512 \
--do_eval \
--output_dir ./results
-
Evaluation on Recag/Rp_C4_55 (
seq_len=512
):
# "validation" split is created from the first 5% samples of original "train" subset
raw_datasets["validation"] = load_dataset("Recag/Rp_C4_55", split="train[:5%]")
Results
{
"eval_accuracy": 0.3561766818954313,
"eval_loss": 3.6318140029907227,
"eval_runtime": 190.8411,
"eval_samples": 19413,
"eval_samples_per_second": 101.723,
"eval_steps_per_second": 1.593,
"perplexity": 37.7812898658763
}
-
Evaluation on Wikitext2 (
seq_len=512
):
{
"eval_accuracy": 0.2718795201225219,
"eval_loss": 4.579628944396973,
"eval_runtime": 3.939,
"eval_samples": 575,
"eval_samples_per_second": 145.976,
"eval_steps_per_second": 0.762,
"perplexity": 97.47821765687856
}