Text Generation
Transformers
Safetensors
English
llama
small
cpu
supra
v6
tiny
mini
open
open-source
text-generation-inference
Instructions to use SupraLabs/Supra-Mini-v6-1M with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use SupraLabs/Supra-Mini-v6-1M with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-generation", model="SupraLabs/Supra-Mini-v6-1M")# Load model directly from transformers import AutoTokenizer, AutoModelForCausalLM tokenizer = AutoTokenizer.from_pretrained("SupraLabs/Supra-Mini-v6-1M") model = AutoModelForCausalLM.from_pretrained("SupraLabs/Supra-Mini-v6-1M", device_map="auto") - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use SupraLabs/Supra-Mini-v6-1M with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "SupraLabs/Supra-Mini-v6-1M" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "SupraLabs/Supra-Mini-v6-1M", "prompt": "Once upon a time,", "max_tokens": 512, "temperature": 0.5 }'Use Docker
docker model run hf.co/SupraLabs/Supra-Mini-v6-1M
- SGLang
How to use SupraLabs/Supra-Mini-v6-1M with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "SupraLabs/Supra-Mini-v6-1M" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "SupraLabs/Supra-Mini-v6-1M", "prompt": "Once upon a time,", "max_tokens": 512, "temperature": 0.5 }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "SupraLabs/Supra-Mini-v6-1M" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "SupraLabs/Supra-Mini-v6-1M", "prompt": "Once upon a time,", "max_tokens": 512, "temperature": 0.5 }' - Docker Model Runner
How to use SupraLabs/Supra-Mini-v6-1M with Docker Model Runner:
docker model run hf.co/SupraLabs/Supra-Mini-v6-1M
| [*] Loading tokenizer... | |
| [*] Building token bin (5,000,000,000 toks)... | |
| Resolving data files: 100%|βββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββ| 2410/2410 [00:00<00:00, 73891.96it/s] | |
| Warning: You are sending unauthenticated requests to the HF Hub. Please set a HF_TOKEN to enable higher rate limits and faster downloads. | |
| Resolving data files: 100%|βββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββ| 104/104 [00:00<00:00, 11861.20it/s] | |
| Resolving data files: 100%|βββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββ| 104/104 [00:00<00:00, 12369.42it/s] | |
| tok: 100%|ββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββ| 5000000000/5000000000 [1:33:07<00:00, 894805.19tok/s] | |
| [+] Train: 4,877,929 chunks | Val: 4,882 chunks | |
| [*] Params: 1,410,688 | |
| [*] Start loss (ln vocab): 8.318 | |
| 0%| | 0/19055 [00:00<?, ?it/s]W0527 17:54:23.983000 1618 torch/_inductor/utils.py:1731] [0/0] Not enough SMs to use max_autotune_gemm mode | |
| {'loss': '8.227', 'grad_norm': '0.7283', 'learning_rate': '5.88e-05', 'epoch': '0.002624'} | |
| {'loss': '8.038', 'grad_norm': '0.6902', 'learning_rate': '0.0001188', 'epoch': '0.005248'} | |
| {'loss': '7.801', 'grad_norm': '0.696', 'learning_rate': '0.0001788', 'epoch': '0.007872'} | |
| {'loss': '7.514', 'grad_norm': '0.668', 'learning_rate': '0.0002388', 'epoch': '0.0105'} | |
| {'loss': '7.195', 'grad_norm': '0.6472', 'learning_rate': '0.0002988', 'epoch': '0.01312'} | |
| {'loss': '6.88', 'grad_norm': '0.6181', 'learning_rate': '0.0003588', 'epoch': '0.01574'} | |
| {'loss': '6.577', 'grad_norm': '0.5743', 'learning_rate': '0.0004188', 'epoch': '0.01837'} | |
| {'loss': '6.298', 'grad_norm': '0.7578', 'learning_rate': '0.0004788', 'epoch': '0.02099'} | |
| {'loss': '6.038', 'grad_norm': '0.7954', 'learning_rate': '0.0005388', 'epoch': '0.02362'} | |
| {'loss': '5.809', 'grad_norm': '0.6836', 'learning_rate': '0.0005988', 'epoch': '0.02624'} | |
| {'loss': '5.606', 'grad_norm': '0.684', 'learning_rate': '0.0006', 'epoch': '0.02886'} | |
| {'loss': '5.436', 'grad_norm': '0.8624', 'learning_rate': '0.0006', 'epoch': '0.03149'} | |
| {'loss': '5.29', 'grad_norm': '0.9148', 'learning_rate': '0.0006', 'epoch': '0.03411'} | |
| {'loss': '5.167', 'grad_norm': '0.8274', 'learning_rate': '0.0006', 'epoch': '0.03674'} | |
| {'loss': '5.059', 'grad_norm': '1.218', 'learning_rate': '0.0006', 'epoch': '0.03936'} | |
| {'loss': '4.964', 'grad_norm': '1', 'learning_rate': '0.0006', 'epoch': '0.04198'} | |
| {'loss': '4.881', 'grad_norm': '1.025', 'learning_rate': '0.0006', 'epoch': '0.04461'} | |
| {'loss': '4.806', 'grad_norm': '1.083', 'learning_rate': '0.0006', 'epoch': '0.04723'} | |
| {'loss': '4.741', 'grad_norm': '1.216', 'learning_rate': '0.0006', 'epoch': '0.04986'} | |
| {'loss': '4.679', 'grad_norm': '1.171', 'learning_rate': '0.0006', 'epoch': '0.05248'} | |
| {'eval_loss': '4.657', 'eval_runtime': '5.59', 'eval_samples_per_second': '873.3', 'eval_steps_per_second': '13.77', 'epoch': '0.05248'} | |
| {'loss': '4.625', 'grad_norm': '1.318', 'learning_rate': '0.0006', 'epoch': '0.05511'} | |
| {'loss': '4.576', 'grad_norm': '1.34', 'learning_rate': '0.0006', 'epoch': '0.05773'} | |
| {'loss': '4.534', 'grad_norm': '1.206', 'learning_rate': '0.0006', 'epoch': '0.06035'} | |
| {'loss': '4.494', 'grad_norm': '1.141', 'learning_rate': '0.0006', 'epoch': '0.06298'} | |
| {'loss': '4.455', 'grad_norm': '0.9871', 'learning_rate': '0.0006', 'epoch': '0.0656'} | |
| {'loss': '4.421', 'grad_norm': '1.049', 'learning_rate': '0.0006', 'epoch': '0.06823'} | |
| {'loss': '4.391', 'grad_norm': '1.222', 'learning_rate': '0.0006', 'epoch': '0.07085'} | |
| {'loss': '4.361', 'grad_norm': '1.092', 'learning_rate': '0.0006', 'epoch': '0.07347'} | |
| {'loss': '4.337', 'grad_norm': '1.139', 'learning_rate': '0.0006', 'epoch': '0.0761'} | |
| {'loss': '4.308', 'grad_norm': '1.121', 'learning_rate': '0.0006', 'epoch': '0.07872'} | |
| {'loss': '4.284', 'grad_norm': '1.174', 'learning_rate': '0.0006', 'epoch': '0.08135'} | |
| {'loss': '4.265', 'grad_norm': '1.132', 'learning_rate': '0.0006', 'epoch': '0.08397'} | |
| {'loss': '4.243', 'grad_norm': '1.116', 'learning_rate': '0.0006', 'epoch': '0.08659'} | |
| {'loss': '4.224', 'grad_norm': '1.198', 'learning_rate': '0.0006', 'epoch': '0.08922'} | |
| {'loss': '4.208', 'grad_norm': '1.088', 'learning_rate': '0.0006', 'epoch': '0.09184'} | |
| {'loss': '4.19', 'grad_norm': '1.184', 'learning_rate': '0.0006', 'epoch': '0.09447'} | |
| {'loss': '4.172', 'grad_norm': '1.203', 'learning_rate': '0.0006', 'epoch': '0.09709'} | |
| {'loss': '4.162', 'grad_norm': '1.132', 'learning_rate': '0.0006', 'epoch': '0.09971'} | |
| {'loss': '4.147', 'grad_norm': '0.9959', 'learning_rate': '0.0006', 'epoch': '0.1023'} | |
| {'loss': '4.13', 'grad_norm': '1.091', 'learning_rate': '0.0006', 'epoch': '0.105'} | |
| {'eval_loss': '4.13', 'eval_runtime': '4.881', 'eval_samples_per_second': '1000', 'eval_steps_per_second': '15.78', 'epoch': '0.105'} | |
| {'loss': '4.12', 'grad_norm': '1.091', 'learning_rate': '0.0006', 'epoch': '0.1076'} | |
| {'loss': '4.103', 'grad_norm': '1.21', 'learning_rate': '0.0006', 'epoch': '0.1102'} | |
| {'loss': '4.091', 'grad_norm': '1.367', 'learning_rate': '0.0006', 'epoch': '0.1128'} | |
| {'loss': '4.084', 'grad_norm': '1.342', 'learning_rate': '0.0006', 'epoch': '0.1155'} | |
| {'loss': '4.075', 'grad_norm': '1.142', 'learning_rate': '0.0006', 'epoch': '0.1181'} | |
| {'loss': '4.064', 'grad_norm': '1.112', 'learning_rate': '0.0006', 'epoch': '0.1207'} | |
| {'loss': '4.049', 'grad_norm': '1.185', 'learning_rate': '0.0006', 'epoch': '0.1233'} | |
| {'loss': '4.042', 'grad_norm': '1.343', 'learning_rate': '0.0006', 'epoch': '0.126'} | |
| {'loss': '4.038', 'grad_norm': '0.8788', 'learning_rate': '0.0006', 'epoch': '0.1286'} | |
| {'loss': '4.027', 'grad_norm': '1.12', 'learning_rate': '0.0006', 'epoch': '0.1312'} | |
| {'loss': '4.014', 'grad_norm': '1.072', 'learning_rate': '0.0006', 'epoch': '0.1338'} | |
| {'loss': '4.017', 'grad_norm': '0.9065', 'learning_rate': '0.0006', 'epoch': '0.1365'} | |
| {'loss': '4.003', 'grad_norm': '0.9136', 'learning_rate': '0.0006', 'epoch': '0.1391'} | |
| {'loss': '3.996', 'grad_norm': '1.087', 'learning_rate': '0.0006', 'epoch': '0.1417'} | |
| {'loss': '3.989', 'grad_norm': '1.02', 'learning_rate': '0.0006', 'epoch': '0.1443'} | |
| {'loss': '3.983', 'grad_norm': '1.069', 'learning_rate': '0.0006', 'epoch': '0.1469'} | |
| {'loss': '3.979', 'grad_norm': '1.15', 'learning_rate': '0.0006', 'epoch': '0.1496'} | |
| {'loss': '3.971', 'grad_norm': '1.034', 'learning_rate': '0.0006', 'epoch': '0.1522'} | |
| {'loss': '3.972', 'grad_norm': '1.279', 'learning_rate': '0.0006', 'epoch': '0.1548'} | |
| {'loss': '3.962', 'grad_norm': '1.05', 'learning_rate': '0.0006', 'epoch': '0.1574'} | |
| {'eval_loss': '3.964', 'eval_runtime': '4.878', 'eval_samples_per_second': '1001', 'eval_steps_per_second': '15.79', 'epoch': '0.1574'} | |
| {'loss': '3.953', 'grad_norm': '1.111', 'learning_rate': '0.0006', 'epoch': '0.1601'} | |
| {'loss': '3.943', 'grad_norm': '1.161', 'learning_rate': '0.0006', 'epoch': '0.1627'} | |
| {'loss': '3.943', 'grad_norm': '1.406', 'learning_rate': '0.0006', 'epoch': '0.1653'} | |
| {'loss': '3.94', 'grad_norm': '1.054', 'learning_rate': '0.0006', 'epoch': '0.1679'} | |
| {'loss': '3.935', 'grad_norm': '1.063', 'learning_rate': '0.0006', 'epoch': '0.1706'} | |
| {'loss': '3.928', 'grad_norm': '1.263', 'learning_rate': '0.0006', 'epoch': '0.1732'} | |
| {'loss': '3.926', 'grad_norm': '1.178', 'learning_rate': '0.0006', 'epoch': '0.1758'} | |
| {'loss': '3.921', 'grad_norm': '1.169', 'learning_rate': '0.0006', 'epoch': '0.1784'} | |
| {'loss': '3.915', 'grad_norm': '1.211', 'learning_rate': '0.0006', 'epoch': '0.1811'} | |
| {'loss': '3.914', 'grad_norm': '1.05', 'learning_rate': '0.0006', 'epoch': '0.1837'} | |
| {'loss': '3.909', 'grad_norm': '0.9622', 'learning_rate': '0.0006', 'epoch': '0.1863'} | |
| {'loss': '3.907', 'grad_norm': '1.089', 'learning_rate': '0.0006', 'epoch': '0.1889'} | |
| {'loss': '3.9', 'grad_norm': '1.001', 'learning_rate': '0.0006', 'epoch': '0.1916'} | |
| {'loss': '3.896', 'grad_norm': '1.125', 'learning_rate': '0.0006', 'epoch': '0.1942'} | |
| {'loss': '3.892', 'grad_norm': '1.257', 'learning_rate': '0.0006', 'epoch': '0.1968'} | |
| {'loss': '3.891', 'grad_norm': '1.007', 'learning_rate': '0.0006', 'epoch': '0.1994'} | |
| {'loss': '3.889', 'grad_norm': '1.002', 'learning_rate': '0.0006', 'epoch': '0.2021'} | |
| {'loss': '3.878', 'grad_norm': '1.135', 'learning_rate': '0.0006', 'epoch': '0.2047'} | |
| {'loss': '3.88', 'grad_norm': '1.252', 'learning_rate': '0.0006', 'epoch': '0.2073'} | |
| {'loss': '3.879', 'grad_norm': '1.155', 'learning_rate': '0.0006', 'epoch': '0.2099'} | |
| {'eval_loss': '3.88', 'eval_runtime': '4.863', 'eval_samples_per_second': '1004', 'eval_steps_per_second': '15.83', 'epoch': '0.2099'} | |
| {'loss': '3.876', 'grad_norm': '0.9475', 'learning_rate': '0.0006', 'epoch': '0.2125'} | |
| {'loss': '3.872', 'grad_norm': '1.052', 'learning_rate': '0.0006', 'epoch': '0.2152'} | |
| {'loss': '3.864', 'grad_norm': '1.361', 'learning_rate': '0.0006', 'epoch': '0.2178'} | |
| {'loss': '3.862', 'grad_norm': '1.043', 'learning_rate': '0.0006', 'epoch': '0.2204'} | |
| {'loss': '3.859', 'grad_norm': '0.9569', 'learning_rate': '0.0006', 'epoch': '0.223'} | |
| {'loss': '3.865', 'grad_norm': '1.077', 'learning_rate': '0.0006', 'epoch': '0.2257'} | |
| {'loss': '3.855', 'grad_norm': '1.143', 'learning_rate': '0.0006', 'epoch': '0.2283'} | |
| {'loss': '3.852', 'grad_norm': '1.075', 'learning_rate': '0.0006', 'epoch': '0.2309'} | |
| {'loss': '3.851', 'grad_norm': '1.295', 'learning_rate': '0.0006', 'epoch': '0.2335'} | |
| {'loss': '3.843', 'grad_norm': '1.165', 'learning_rate': '0.0006', 'epoch': '0.2362'} | |
| {'loss': '3.848', 'grad_norm': '1.212', 'learning_rate': '0.0006', 'epoch': '0.2388'} | |
| {'loss': '3.842', 'grad_norm': '0.9721', 'learning_rate': '0.0006', 'epoch': '0.2414'} | |
| {'loss': '3.84', 'grad_norm': '1.315', 'learning_rate': '0.0006', 'epoch': '0.244'} | |
| {'loss': '3.84', 'grad_norm': '1.171', 'learning_rate': '0.0006', 'epoch': '0.2467'} | |
| {'loss': '3.836', 'grad_norm': '1.172', 'learning_rate': '0.0006', 'epoch': '0.2493'} | |
| {'loss': '3.829', 'grad_norm': '1.083', 'learning_rate': '0.0006', 'epoch': '0.2519'} | |
| {'loss': '3.83', 'grad_norm': '1.111', 'learning_rate': '0.0006', 'epoch': '0.2545'} | |
| {'loss': '3.825', 'grad_norm': '1.074', 'learning_rate': '0.0006', 'epoch': '0.2572'} | |
| {'loss': '3.82', 'grad_norm': '1.07', 'learning_rate': '0.0006', 'epoch': '0.2598'} | |
| {'loss': '3.818', 'grad_norm': '1.247', 'learning_rate': '0.0006', 'epoch': '0.2624'} | |
| {'eval_loss': '3.827', 'eval_runtime': '4.858', 'eval_samples_per_second': '1005', 'eval_steps_per_second': '15.85', 'epoch': '0.2624'} | |
| Writing model shards: 100%|ββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββ| 1/1 [00:00<00:00, 25.40it/s] | |
| {'loss': '3.822', 'grad_norm': '0.9996', 'learning_rate': '0.0006', 'epoch': '0.265'} | |
| {'loss': '3.817', 'grad_norm': '0.902', 'learning_rate': '0.0006', 'epoch': '0.2677'} | |
| {'loss': '3.816', 'grad_norm': '1.125', 'learning_rate': '0.0006', 'epoch': '0.2703'} | |
| {'loss': '3.811', 'grad_norm': '1.227', 'learning_rate': '0.0006', 'epoch': '0.2729'} | |
| {'loss': '3.81', 'grad_norm': '1.1', 'learning_rate': '0.0006', 'epoch': '0.2755'} | |
| {'loss': '3.803', 'grad_norm': '0.9489', 'learning_rate': '0.0006', 'epoch': '0.2781'} | |
| {'loss': '3.8', 'grad_norm': '0.9645', 'learning_rate': '0.0006', 'epoch': '0.2808'} | |
| {'loss': '3.805', 'grad_norm': '1.035', 'learning_rate': '0.0006', 'epoch': '0.2834'} | |
| {'loss': '3.793', 'grad_norm': '1.34', 'learning_rate': '0.0006', 'epoch': '0.286'} | |
| {'loss': '3.792', 'grad_norm': '1.168', 'learning_rate': '0.0006', 'epoch': '0.2886'} | |
| {'loss': '3.795', 'grad_norm': '1.125', 'learning_rate': '0.0006', 'epoch': '0.2913'} | |
| {'loss': '3.793', 'grad_norm': '1.004', 'learning_rate': '0.0006', 'epoch': '0.2939'} | |
| {'loss': '3.789', 'grad_norm': '1.365', 'learning_rate': '0.0006', 'epoch': '0.2965'} | |
| {'loss': '3.784', 'grad_norm': '1.118', 'learning_rate': '0.0006', 'epoch': '0.2991'} | |
| {'loss': '3.788', 'grad_norm': '1.181', 'learning_rate': '0.0006', 'epoch': '0.3018'} | |
| {'loss': '3.777', 'grad_norm': '1.173', 'learning_rate': '0.0006', 'epoch': '0.3044'} | |
| {'loss': '3.777', 'grad_norm': '1.178', 'learning_rate': '0.0006', 'epoch': '0.307'} | |
| {'loss': '3.774', 'grad_norm': '0.9736', 'learning_rate': '0.0006', 'epoch': '0.3096'} | |
| {'loss': '3.77', 'grad_norm': '1.433', 'learning_rate': '0.0006', 'epoch': '0.3123'} | |
| {'loss': '3.766', 'grad_norm': '1.02', 'learning_rate': '0.0006', 'epoch': '0.3149'} | |
| {'eval_loss': '3.775', 'eval_runtime': '4.866', 'eval_samples_per_second': '1003', 'eval_steps_per_second': '15.82', 'epoch': '0.3149'} | |
| {'loss': '3.769', 'grad_norm': '0.8966', 'learning_rate': '0.0006', 'epoch': '0.3175'} | |
| {'loss': '3.765', 'grad_norm': '1.001', 'learning_rate': '0.0006', 'epoch': '0.3201'} | |
| {'loss': '3.764', 'grad_norm': '1.359', 'learning_rate': '0.0006', 'epoch': '0.3228'} | |
| {'loss': '3.76', 'grad_norm': '1.109', 'learning_rate': '0.0006', 'epoch': '0.3254'} | |
| {'loss': '3.757', 'grad_norm': '1.039', 'learning_rate': '0.0006', 'epoch': '0.328'} | |
| {'loss': '3.752', 'grad_norm': '1.002', 'learning_rate': '0.0006', 'epoch': '0.3306'} | |
| {'loss': '3.749', 'grad_norm': '1.246', 'learning_rate': '0.0006', 'epoch': '0.3333'} | |
| {'loss': '3.749', 'grad_norm': '1.134', 'learning_rate': '0.0006', 'epoch': '0.3359'} | |
| {'loss': '3.744', 'grad_norm': '1.219', 'learning_rate': '0.0006', 'epoch': '0.3385'} | |
| {'loss': '3.736', 'grad_norm': '1.022', 'learning_rate': '0.0006', 'epoch': '0.3411'} | |
| {'loss': '3.738', 'grad_norm': '1.202', 'learning_rate': '0.0006', 'epoch': '0.3438'} | |
| {'loss': '3.733', 'grad_norm': '0.9703', 'learning_rate': '0.0006', 'epoch': '0.3464'} | |
| {'loss': '3.737', 'grad_norm': '1.134', 'learning_rate': '0.0006', 'epoch': '0.349'} | |
| {'loss': '3.738', 'grad_norm': '1.171', 'learning_rate': '0.0006', 'epoch': '0.3516'} | |
| {'loss': '3.725', 'grad_norm': '1.167', 'learning_rate': '0.0006', 'epoch': '0.3542'} | |
| {'loss': '3.728', 'grad_norm': '1.179', 'learning_rate': '0.0006', 'epoch': '0.3569'} | |
| {'loss': '3.721', 'grad_norm': '1.007', 'learning_rate': '0.0006', 'epoch': '0.3595'} | |
| {'loss': '3.713', 'grad_norm': '1.018', 'learning_rate': '0.0006', 'epoch': '0.3621'} | |
| {'loss': '3.715', 'grad_norm': '1.017', 'learning_rate': '0.0006', 'epoch': '0.3647'} | |
| {'loss': '3.714', 'grad_norm': '1.168', 'learning_rate': '0.0006', 'epoch': '0.3674'} | |
| {'eval_loss': '3.719', 'eval_runtime': '4.864', 'eval_samples_per_second': '1004', 'eval_steps_per_second': '15.83', 'epoch': '0.3674'} | |
| {'loss': '3.712', 'grad_norm': '1.241', 'learning_rate': '0.0006', 'epoch': '0.37'} | |
| {'loss': '3.703', 'grad_norm': '1.076', 'learning_rate': '0.0006', 'epoch': '0.3726'} | |
| {'loss': '3.699', 'grad_norm': '1.186', 'learning_rate': '0.0006', 'epoch': '0.3752'} | |
| {'loss': '3.697', 'grad_norm': '1.17', 'learning_rate': '0.0006', 'epoch': '0.3779'} | |
| {'loss': '3.694', 'grad_norm': '1.177', 'learning_rate': '0.0006', 'epoch': '0.3805'} | |
| {'loss': '3.696', 'grad_norm': '1.564', 'learning_rate': '0.0006', 'epoch': '0.3831'} | |
| {'loss': '3.685', 'grad_norm': '1.024', 'learning_rate': '0.0006', 'epoch': '0.3857'} | |
| {'loss': '3.683', 'grad_norm': '1.021', 'learning_rate': '0.0006', 'epoch': '0.3884'} | |
| {'loss': '3.683', 'grad_norm': '1.21', 'learning_rate': '0.0006', 'epoch': '0.391'} | |
| {'loss': '3.678', 'grad_norm': '1.113', 'learning_rate': '0.0006', 'epoch': '0.3936'} | |
| {'loss': '3.677', 'grad_norm': '1.306', 'learning_rate': '0.0006', 'epoch': '0.3962'} | |
| {'loss': '3.671', 'grad_norm': '1.035', 'learning_rate': '0.0006', 'epoch': '0.3989'} | |
| {'loss': '3.67', 'grad_norm': '1.2', 'learning_rate': '0.0006', 'epoch': '0.4015'} | |
| {'loss': '3.669', 'grad_norm': '1.258', 'learning_rate': '0.0006', 'epoch': '0.4041'} | |
| {'loss': '3.662', 'grad_norm': '1.257', 'learning_rate': '0.0006', 'epoch': '0.4067'} | |
| {'loss': '3.666', 'grad_norm': '1.067', 'learning_rate': '0.0006', 'epoch': '0.4094'} | |
| {'loss': '3.652', 'grad_norm': '1.215', 'learning_rate': '0.0006', 'epoch': '0.412'} | |
| {'loss': '3.653', 'grad_norm': '1.414', 'learning_rate': '0.0006', 'epoch': '0.4146'} | |
| {'loss': '3.659', 'grad_norm': '1.083', 'learning_rate': '0.0006', 'epoch': '0.4172'} | |
| {'loss': '3.652', 'grad_norm': '1.21', 'learning_rate': '0.0006', 'epoch': '0.4198'} | |
| {'eval_loss': '3.658', 'eval_runtime': '4.867', 'eval_samples_per_second': '1003', 'eval_steps_per_second': '15.82', 'epoch': '0.4198'} | |
| {'loss': '3.645', 'grad_norm': '1.284', 'learning_rate': '0.0006', 'epoch': '0.4225'} | |
| {'loss': '3.649', 'grad_norm': '1.008', 'learning_rate': '0.0006', 'epoch': '0.4251'} | |
| {'loss': '3.647', 'grad_norm': '1.192', 'learning_rate': '0.0006', 'epoch': '0.4277'} | |
| {'loss': '3.639', 'grad_norm': '1.212', 'learning_rate': '0.0006', 'epoch': '0.4303'} | |
| {'loss': '3.64', 'grad_norm': '1.216', 'learning_rate': '0.0006', 'epoch': '0.433'} | |
| {'loss': '3.637', 'grad_norm': '1.013', 'learning_rate': '0.0006', 'epoch': '0.4356'} | |
| {'loss': '3.634', 'grad_norm': '1.737', 'learning_rate': '0.0006', 'epoch': '0.4382'} | |
| {'loss': '3.635', 'grad_norm': '1.41', 'learning_rate': '0.0006', 'epoch': '0.4408'} | |
| {'loss': '3.626', 'grad_norm': '1.318', 'learning_rate': '0.0006', 'epoch': '0.4435'} | |
| {'loss': '3.627', 'grad_norm': '1.097', 'learning_rate': '0.0006', 'epoch': '0.4461'} | |
| {'loss': '3.622', 'grad_norm': '1.403', 'learning_rate': '0.0006', 'epoch': '0.4487'} | |
| {'loss': '3.619', 'grad_norm': '1.514', 'learning_rate': '0.0006', 'epoch': '0.4513'} | |
| {'loss': '3.62', 'grad_norm': '1.294', 'learning_rate': '0.0006', 'epoch': '0.454'} | |
| {'loss': '3.615', 'grad_norm': '1.153', 'learning_rate': '0.0006', 'epoch': '0.4566'} | |
| {'loss': '3.614', 'grad_norm': '1.241', 'learning_rate': '0.0006', 'epoch': '0.4592'} | |
| {'loss': '3.618', 'grad_norm': '1.279', 'learning_rate': '0.0006', 'epoch': '0.4618'} | |
| {'loss': '3.613', 'grad_norm': '1.147', 'learning_rate': '0.0006', 'epoch': '0.4645'} | |
| {'loss': '3.61', 'grad_norm': '1.553', 'learning_rate': '0.0006', 'epoch': '0.4671'} | |
| {'loss': '3.614', 'grad_norm': '1.441', 'learning_rate': '0.0006', 'epoch': '0.4697'} | |
| {'loss': '3.609', 'grad_norm': '1.309', 'learning_rate': '0.0006', 'epoch': '0.4723'} | |
| {'eval_loss': '3.614', 'eval_runtime': '4.858', 'eval_samples_per_second': '1005', 'eval_steps_per_second': '15.85', 'epoch': '0.4723'} | |
| {'loss': '3.607', 'grad_norm': '1.344', 'learning_rate': '0.0006', 'epoch': '0.475'} | |
| {'loss': '3.602', 'grad_norm': '1.086', 'learning_rate': '0.0006', 'epoch': '0.4776'} | |
| {'loss': '3.604', 'grad_norm': '1.36', 'learning_rate': '0.0006', 'epoch': '0.4802'} | |
| {'loss': '3.603', 'grad_norm': '1.438', 'learning_rate': '0.0006', 'epoch': '0.4828'} | |
| {'loss': '3.604', 'grad_norm': '1.488', 'learning_rate': '0.0006', 'epoch': '0.4854'} | |
| {'loss': '3.596', 'grad_norm': '1.294', 'learning_rate': '0.0006', 'epoch': '0.4881'} | |
| {'loss': '3.596', 'grad_norm': '1.285', 'learning_rate': '0.0006', 'epoch': '0.4907'} | |
| {'loss': '3.593', 'grad_norm': '1.2', 'learning_rate': '0.0006', 'epoch': '0.4933'} | |
| {'loss': '3.597', 'grad_norm': '1.467', 'learning_rate': '0.0006', 'epoch': '0.4959'} | |
| {'loss': '3.593', 'grad_norm': '1.132', 'learning_rate': '0.0006', 'epoch': '0.4986'} | |
| {'loss': '3.592', 'grad_norm': '1.315', 'learning_rate': '0.0006', 'epoch': '0.5012'} | |
| {'loss': '3.591', 'grad_norm': '1.284', 'learning_rate': '0.0006', 'epoch': '0.5038'} | |
| {'loss': '3.59', 'grad_norm': '1.311', 'learning_rate': '0.0006', 'epoch': '0.5064'} | |
| {'loss': '3.586', 'grad_norm': '1.581', 'learning_rate': '0.0006', 'epoch': '0.5091'} | |
| {'loss': '3.585', 'grad_norm': '1.125', 'learning_rate': '0.0006', 'epoch': '0.5117'} | |
| {'loss': '3.582', 'grad_norm': '1.432', 'learning_rate': '0.0006', 'epoch': '0.5143'} | |
| {'loss': '3.582', 'grad_norm': '1.503', 'learning_rate': '0.0006', 'epoch': '0.5169'} | |
| {'loss': '3.583', 'grad_norm': '1.228', 'learning_rate': '0.0006', 'epoch': '0.5196'} | |
| {'loss': '3.581', 'grad_norm': '1.54', 'learning_rate': '0.0006', 'epoch': '0.5222'} | |
| {'loss': '3.577', 'grad_norm': '1.214', 'learning_rate': '0.0006', 'epoch': '0.5248'} | |
| {'eval_loss': '3.583', 'eval_runtime': '4.857', 'eval_samples_per_second': '1005', 'eval_steps_per_second': '15.85', 'epoch': '0.5248'} | |
| Writing model shards: 100%|βββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββ| 1/1 [00:00<00:00, 316.50it/s] | |
| {'loss': '3.575', 'grad_norm': '1.369', 'learning_rate': '0.0006', 'epoch': '0.5274'} | |
| {'loss': '3.576', 'grad_norm': '1.212', 'learning_rate': '0.0006', 'epoch': '0.5301'} | |
| {'loss': '3.572', 'grad_norm': '1.275', 'learning_rate': '0.0006', 'epoch': '0.5327'} | |
| {'loss': '3.57', 'grad_norm': '1.238', 'learning_rate': '0.0006', 'epoch': '0.5353'} | |
| {'loss': '3.573', 'grad_norm': '1.137', 'learning_rate': '0.0006', 'epoch': '0.5379'} | |
| {'loss': '3.566', 'grad_norm': '1.14', 'learning_rate': '0.0006', 'epoch': '0.5406'} | |
| {'loss': '3.57', 'grad_norm': '1.506', 'learning_rate': '0.0006', 'epoch': '0.5432'} | |
| {'loss': '3.562', 'grad_norm': '1.633', 'learning_rate': '0.0006', 'epoch': '0.5458'} | |
| {'loss': '3.563', 'grad_norm': '1.325', 'learning_rate': '0.0006', 'epoch': '0.5484'} | |
| {'loss': '3.569', 'grad_norm': '1.14', 'learning_rate': '0.0006', 'epoch': '0.5511'} | |
| {'loss': '3.568', 'grad_norm': '1.337', 'learning_rate': '0.0006', 'epoch': '0.5537'} | |
| {'loss': '3.562', 'grad_norm': '1.167', 'learning_rate': '0.0006', 'epoch': '0.5563'} | |
| {'loss': '3.564', 'grad_norm': '1.439', 'learning_rate': '0.0006', 'epoch': '0.5589'} | |
| {'loss': '3.557', 'grad_norm': '1.194', 'learning_rate': '0.0006', 'epoch': '0.5615'} | |
| {'loss': '3.561', 'grad_norm': '1.25', 'learning_rate': '0.0006', 'epoch': '0.5642'} | |
| {'loss': '3.561', 'grad_norm': '1.09', 'learning_rate': '0.0006', 'epoch': '0.5668'} | |
| {'loss': '3.556', 'grad_norm': '1.259', 'learning_rate': '0.0006', 'epoch': '0.5694'} | |
| {'loss': '3.555', 'grad_norm': '1.039', 'learning_rate': '0.0006', 'epoch': '0.572'} | |
| {'loss': '3.553', 'grad_norm': '1.164', 'learning_rate': '0.0006', 'epoch': '0.5747'} | |
| {'loss': '3.557', 'grad_norm': '1.108', 'learning_rate': '0.0006', 'epoch': '0.5773'} | |
| {'eval_loss': '3.56', 'eval_runtime': '4.875', 'eval_samples_per_second': '1001', 'eval_steps_per_second': '15.79', 'epoch': '0.5773'} | |
| {'loss': '3.551', 'grad_norm': '1.286', 'learning_rate': '0.0006', 'epoch': '0.5799'} | |
| {'loss': '3.554', 'grad_norm': '1.081', 'learning_rate': '0.0006', 'epoch': '0.5825'} | |
| {'loss': '3.549', 'grad_norm': '1.148', 'learning_rate': '0.0006', 'epoch': '0.5852'} | |
| {'loss': '3.551', 'grad_norm': '1.361', 'learning_rate': '0.0006', 'epoch': '0.5878'} | |
| {'loss': '3.545', 'grad_norm': '1.309', 'learning_rate': '0.0006', 'epoch': '0.5904'} | |
| {'loss': '3.554', 'grad_norm': '1.403', 'learning_rate': '0.0006', 'epoch': '0.593'} | |
| {'loss': '3.547', 'grad_norm': '1.282', 'learning_rate': '0.0006', 'epoch': '0.5957'} | |
| {'loss': '3.545', 'grad_norm': '1.761', 'learning_rate': '0.0006', 'epoch': '0.5983'} | |
| {'loss': '3.545', 'grad_norm': '1.162', 'learning_rate': '0.0006', 'epoch': '0.6009'} | |
| {'loss': '3.541', 'grad_norm': '1.158', 'learning_rate': '0.0006', 'epoch': '0.6035'} | |
| {'loss': '3.544', 'grad_norm': '1.203', 'learning_rate': '0.0006', 'epoch': '0.6062'} | |
| {'loss': '3.542', 'grad_norm': '1.434', 'learning_rate': '0.0006', 'epoch': '0.6088'} | |
| 61%|ββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββ | 11646/19055 [2:17:55<1:27:07, 1.42it/s] | |
| {'loss': '3.54', 'grad_norm': '1.307', 'learning_rate': '0.0006', 'epoch': '0.614'} | |
| {'loss': '3.538', 'grad_norm': '1.184', 'learning_rate': '0.0006', 'epoch': '0.6167'} | |
| {'loss': '3.546', 'grad_norm': '1.012', 'learning_rate': '0.0006', 'epoch': '0.6193'} | |
| {'loss': '3.533', 'grad_norm': '1.723', 'learning_rate': '0.0006', 'epoch': '0.6219'} | |
| {'loss': '3.533', 'grad_norm': '1.476', 'learning_rate': '0.0006', 'epoch': '0.6245'} | |
| {'loss': '3.534', 'grad_norm': '1.369', 'learning_rate': '0.0006', 'epoch': '0.6271'} | |
| {'loss': '3.529', 'grad_norm': '1.305', 'learning_rate': '0.0006', 'epoch': '0.6298'} | |
| {'eval_loss': '3.542', 'eval_runtime': '4.891', 'eval_samples_per_second': '998.2', 'eval_steps_per_second': '15.74', 'epoch': '0.6298'} | |
| {'loss': '3.534', 'grad_norm': '1.391', 'learning_rate': '0.0006', 'epoch': '0.6324'} | |
| {'loss': '3.533', 'grad_norm': '1.358', 'learning_rate': '0.0006', 'epoch': '0.635'} | |
| {'loss': '3.529', 'grad_norm': '1.388', 'learning_rate': '0.0006', 'epoch': '0.6376'} | |
| {'loss': '3.529', 'grad_norm': '1.124', 'learning_rate': '0.0006', 'epoch': '0.6403'} | |
| {'loss': '3.531', 'grad_norm': '1.203', 'learning_rate': '0.0006', 'epoch': '0.6429'} | |
| {'loss': '3.529', 'grad_norm': '1.082', 'learning_rate': '0.0006', 'epoch': '0.6455'} | |
| {'loss': '3.527', 'grad_norm': '1.249', 'learning_rate': '0.0006', 'epoch': '0.6481'} | |
| {'loss': '3.529', 'grad_norm': '1.5', 'learning_rate': '0.0006', 'epoch': '0.6508'} | |
| {'loss': '3.53', 'grad_norm': '1.246', 'learning_rate': '0.0006', 'epoch': '0.6534'} | |
| {'loss': '3.527', 'grad_norm': '1.125', 'learning_rate': '0.0006', 'epoch': '0.656'} | |
| {'loss': '3.524', 'grad_norm': '1.199', 'learning_rate': '0.0006', 'epoch': '0.6586'} | |
| {'loss': '3.522', 'grad_norm': '1.296', 'learning_rate': '0.0006', 'epoch': '0.6613'} | |
| {'loss': '3.519', 'grad_norm': '1.61', 'learning_rate': '0.0006', 'epoch': '0.6639'} | |
| {'loss': '3.524', 'grad_norm': '1.227', 'learning_rate': '0.0006', 'epoch': '0.6665'} | |
| {'loss': '3.518', 'grad_norm': '1.122', 'learning_rate': '0.0006', 'epoch': '0.6691'} | |
| {'loss': '3.517', 'grad_norm': '1.301', 'learning_rate': '0.0006', 'epoch': '0.6718'} | |
| {'loss': '3.521', 'grad_norm': '1.424', 'learning_rate': '0.0006', 'epoch': '0.6744'} | |
| {'loss': '3.52', 'grad_norm': '1.616', 'learning_rate': '0.0006', 'epoch': '0.677'} | |
| {'loss': '3.522', 'grad_norm': '1.51', 'learning_rate': '0.0006', 'epoch': '0.6796'} | |
| {'loss': '3.517', 'grad_norm': '1.157', 'learning_rate': '0.0006', 'epoch': '0.6823'} | |
| {'eval_loss': '3.527', 'eval_runtime': '4.895', 'eval_samples_per_second': '997.3', 'eval_steps_per_second': '15.73', 'epoch': '0.6823'} | |
| {'loss': '3.512', 'grad_norm': '1.309', 'learning_rate': '0.0006', 'epoch': '0.6849'} | |
| {'loss': '3.51', 'grad_norm': '1.363', 'learning_rate': '0.0006', 'epoch': '0.6875'} | |
| {'loss': '3.518', 'grad_norm': '1.47', 'learning_rate': '0.0006', 'epoch': '0.6901'} | |
| {'loss': '3.519', 'grad_norm': '1.118', 'learning_rate': '0.0006', 'epoch': '0.6927'} | |
| {'loss': '3.507', 'grad_norm': '1.002', 'learning_rate': '0.0006', 'epoch': '0.6954'} | |
| {'loss': '3.511', 'grad_norm': '1.15', 'learning_rate': '0.0006', 'epoch': '0.698'} | |
| {'loss': '3.509', 'grad_norm': '1.864', 'learning_rate': '0.0006', 'epoch': '0.7006'} | |
| {'loss': '3.514', 'grad_norm': '1.233', 'learning_rate': '0.0006', 'epoch': '0.7032'} | |
| {'loss': '3.516', 'grad_norm': '1.745', 'learning_rate': '0.0006', 'epoch': '0.7059'} | |
| {'loss': '3.509', 'grad_norm': '1.469', 'learning_rate': '0.0006', 'epoch': '0.7085'} | |
| {'loss': '3.51', 'grad_norm': '1.27', 'learning_rate': '0.0006', 'epoch': '0.7111'} | |
| {'loss': '3.511', 'grad_norm': '1.133', 'learning_rate': '0.0006', 'epoch': '0.7137'} | |
| {'loss': '3.509', 'grad_norm': '1.186', 'learning_rate': '0.0006', 'epoch': '0.7164'} | |
| {'loss': '3.512', 'grad_norm': '1.357', 'learning_rate': '0.0006', 'epoch': '0.719'} | |
| {'loss': '3.509', 'grad_norm': '1.545', 'learning_rate': '0.0006', 'epoch': '0.7216'} | |
| {'loss': '3.508', 'grad_norm': '1.528', 'learning_rate': '0.0006', 'epoch': '0.7242'} | |
| {'loss': '3.511', 'grad_norm': '1.271', 'learning_rate': '0.0006', 'epoch': '0.7269'} | |
| {'loss': '3.508', 'grad_norm': '1.113', 'learning_rate': '0.0006', 'epoch': '0.7295'} | |
| {'loss': '3.502', 'grad_norm': '1.373', 'learning_rate': '0.0006', 'epoch': '0.7321'} | |
| {'loss': '3.51', 'grad_norm': '1.394', 'learning_rate': '0.0006', 'epoch': '0.7347'} | |
| {'eval_loss': '3.511', 'eval_runtime': '4.854', 'eval_samples_per_second': '1006', 'eval_steps_per_second': '15.87', 'epoch': '0.7347'} | |
| {'loss': '3.504', 'grad_norm': '1.692', 'learning_rate': '0.0006', 'epoch': '0.7374'} | |
| {'loss': '3.504', 'grad_norm': '1.623', 'learning_rate': '0.0006', 'epoch': '0.74'} | |
| {'loss': '3.507', 'grad_norm': '1.438', 'learning_rate': '0.0006', 'epoch': '0.7426'} | |
| {'loss': '3.501', 'grad_norm': '1.341', 'learning_rate': '0.0006', 'epoch': '0.7452'} | |
| {'loss': '3.496', 'grad_norm': '1.161', 'learning_rate': '0.0006', 'epoch': '0.7479'} | |
| {'loss': '3.5', 'grad_norm': '1.286', 'learning_rate': '0.0006', 'epoch': '0.7505'} | |
| {'loss': '3.502', 'grad_norm': '1.214', 'learning_rate': '0.0006', 'epoch': '0.7531'} | |
| {'loss': '3.499', 'grad_norm': '1.186', 'learning_rate': '0.0006', 'epoch': '0.7557'} | |
| {'loss': '3.496', 'grad_norm': '1.328', 'learning_rate': '0.0006', 'epoch': '0.7584'} | |
| {'loss': '3.493', 'grad_norm': '1.377', 'learning_rate': '0.0006', 'epoch': '0.761'} | |
| {'loss': '3.501', 'grad_norm': '1.249', 'learning_rate': '0.0006', 'epoch': '0.7636'} | |
| {'loss': '3.5', 'grad_norm': '1.148', 'learning_rate': '0.0006', 'epoch': '0.7662'} | |
| {'loss': '3.494', 'grad_norm': '1.305', 'learning_rate': '0.0006', 'epoch': '0.7688'} | |
| {'loss': '3.497', 'grad_norm': '1.639', 'learning_rate': '0.0006', 'epoch': '0.7715'} | |
| {'loss': '3.499', 'grad_norm': '1.366', 'learning_rate': '0.0006', 'epoch': '0.7741'} | |
| {'loss': '3.493', 'grad_norm': '1.519', 'learning_rate': '0.0006', 'epoch': '0.7767'} | |
| {'loss': '3.496', 'grad_norm': '1.129', 'learning_rate': '0.0006', 'epoch': '0.7793'} | |
| {'loss': '3.496', 'grad_norm': '1.338', 'learning_rate': '0.0006', 'epoch': '0.782'} | |
| {'loss': '3.502', 'grad_norm': '1.582', 'learning_rate': '0.0006', 'epoch': '0.7846'} | |
| {'loss': '3.489', 'grad_norm': '1.458', 'learning_rate': '0.0006', 'epoch': '0.7872'} | |
| {'eval_loss': '3.501', 'eval_runtime': '4.89', 'eval_samples_per_second': '998.3', 'eval_steps_per_second': '15.75', 'epoch': '0.7872'} | |
| Writing model shards: 100%|βββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββ| 1/1 [00:00<00:00, 317.20it/s] | |
| {'loss': '3.492', 'grad_norm': '1.1', 'learning_rate': '0.0006', 'epoch': '0.7898'} | |
| {'loss': '3.488', 'grad_norm': '1.311', 'learning_rate': '0.0006', 'epoch': '0.7925'} | |
| {'loss': '3.495', 'grad_norm': '1.351', 'learning_rate': '0.0006', 'epoch': '0.7951'} | |
| {'loss': '3.49', 'grad_norm': '1.212', 'learning_rate': '0.0006', 'epoch': '0.7977'} | |
| {'loss': '3.49', 'grad_norm': '1.339', 'learning_rate': '0.0005783', 'epoch': '0.8003'} | |
| {'loss': '3.488', 'grad_norm': '1.22', 'learning_rate': '0.0005279', 'epoch': '0.803'} | |
| {'loss': '3.482', 'grad_norm': '1.23', 'learning_rate': '0.0005004', 'epoch': '0.8056'} | |
| {'loss': '3.477', 'grad_norm': '1.226', 'learning_rate': '0.000479', 'epoch': '0.8082'} | |
| {'loss': '3.48', 'grad_norm': '1.078', 'learning_rate': '0.0004608', 'epoch': '0.8108'} | |
| {'loss': '3.477', 'grad_norm': '1.355', 'learning_rate': '0.0004448', 'epoch': '0.8135'} | |
| {'loss': '3.479', 'grad_norm': '1.367', 'learning_rate': '0.0004303', 'epoch': '0.8161'} | |
| {'loss': '3.473', 'grad_norm': '1.039', 'learning_rate': '0.0004169', 'epoch': '0.8187'} | |
| {'loss': '3.471', 'grad_norm': '1.323', 'learning_rate': '0.0004044', 'epoch': '0.8213'} | |
| {'loss': '3.47', 'grad_norm': '1.047', 'learning_rate': '0.0003927', 'epoch': '0.824'} | |
| {'loss': '3.466', 'grad_norm': '1.248', 'learning_rate': '0.0003816', 'epoch': '0.8266'} | |
| {'loss': '3.47', 'grad_norm': '1.436', 'learning_rate': '0.000371', 'epoch': '0.8292'} | |
| {'loss': '3.465', 'grad_norm': '1.041', 'learning_rate': '0.0003609', 'epoch': '0.8318'} | |
| {'loss': '3.467', 'grad_norm': '1.227', 'learning_rate': '0.0003513', 'epoch': '0.8344'} | |
| {'loss': '3.461', 'grad_norm': '1.486', 'learning_rate': '0.0003419', 'epoch': '0.8371'} | |
| {'loss': '3.467', 'grad_norm': '1.13', 'learning_rate': '0.0003329', 'epoch': '0.8397'} | |
| {'eval_loss': '3.47', 'eval_runtime': '4.885', 'eval_samples_per_second': '999.4', 'eval_steps_per_second': '15.76', 'epoch': '0.8397'} | |
| {'loss': '3.467', 'grad_norm': '0.9442', 'learning_rate': '0.0003242', 'epoch': '0.8423'} | |
| {'loss': '3.461', 'grad_norm': '1.174', 'learning_rate': '0.0003158', 'epoch': '0.8449'} | |
| {'loss': '3.459', 'grad_norm': '0.9959', 'learning_rate': '0.0003076', 'epoch': '0.8476'} | |
| {'loss': '3.458', 'grad_norm': '1.05', 'learning_rate': '0.0002996', 'epoch': '0.8502'} | |
| {'loss': '3.46', 'grad_norm': '1.105', 'learning_rate': '0.0002919', 'epoch': '0.8528'} | |
| {'loss': '3.461', 'grad_norm': '1.051', 'learning_rate': '0.0002843', 'epoch': '0.8554'} | |
| {'loss': '3.452', 'grad_norm': '1.088', 'learning_rate': '0.0002769', 'epoch': '0.8581'} | |
| {'loss': '3.461', 'grad_norm': '1.11', 'learning_rate': '0.0002697', 'epoch': '0.8607'} | |
| {'loss': '3.454', 'grad_norm': '0.9466', 'learning_rate': '0.0002626', 'epoch': '0.8633'} | |
| {'loss': '3.451', 'grad_norm': '1.007', 'learning_rate': '0.0002557', 'epoch': '0.8659'} | |
| {'loss': '3.455', 'grad_norm': '0.9655', 'learning_rate': '0.0002489', 'epoch': '0.8686'} | |
| {'loss': '3.447', 'grad_norm': '1.387', 'learning_rate': '0.0002422', 'epoch': '0.8712'} | |
| {'loss': '3.451', 'grad_norm': '0.857', 'learning_rate': '0.0002357', 'epoch': '0.8738'} | |
| {'loss': '3.449', 'grad_norm': '0.9911', 'learning_rate': '0.0002293', 'epoch': '0.8764'} | |
| {'loss': '3.453', 'grad_norm': '0.9967', 'learning_rate': '0.0002229', 'epoch': '0.8791'} | |
| {'loss': '3.451', 'grad_norm': '0.9249', 'learning_rate': '0.0002167', 'epoch': '0.8817'} | |
| {'loss': '3.45', 'grad_norm': '1.054', 'learning_rate': '0.0002106', 'epoch': '0.8843'} | |
| {'loss': '3.447', 'grad_norm': '0.9105', 'learning_rate': '0.0002046', 'epoch': '0.8869'} | |
| {'loss': '3.449', 'grad_norm': '1.046', 'learning_rate': '0.0001987', 'epoch': '0.8896'} | |
| {'loss': '3.45', 'grad_norm': '0.922', 'learning_rate': '0.0001928', 'epoch': '0.8922'} | |
| {'eval_loss': '3.452', 'eval_runtime': '4.868', 'eval_samples_per_second': '1003', 'eval_steps_per_second': '15.82', 'epoch': '0.8922'} | |
| {'loss': '3.441', 'grad_norm': '0.9974', 'learning_rate': '0.0001871', 'epoch': '0.8948'} | |
| {'loss': '3.444', 'grad_norm': '1.067', 'learning_rate': '0.0001814', 'epoch': '0.8974'} | |
| {'loss': '3.443', 'grad_norm': '1.113', 'learning_rate': '0.0001758', 'epoch': '0.9'} | |
| {'loss': '3.442', 'grad_norm': '1.111', 'learning_rate': '0.0001703', 'epoch': '0.9027'} | |
| {'loss': '3.437', 'grad_norm': '1.144', 'learning_rate': '0.0001648', 'epoch': '0.9053'} | |
| {'loss': '3.437', 'grad_norm': '0.9689', 'learning_rate': '0.0001594', 'epoch': '0.9079'} | |
| {'loss': '3.434', 'grad_norm': '0.9649', 'learning_rate': '0.0001541', 'epoch': '0.9105'} | |
| {'loss': '3.438', 'grad_norm': '0.9678', 'learning_rate': '0.0001488', 'epoch': '0.9132'} | |
| {'loss': '3.438', 'grad_norm': '1.095', 'learning_rate': '0.0001436', 'epoch': '0.9158'} | |
| {'loss': '3.437', 'grad_norm': '0.9392', 'learning_rate': '0.0001385', 'epoch': '0.9184'} | |
| {'loss': '3.439', 'grad_norm': '0.9008', 'learning_rate': '0.0001334', 'epoch': '0.921'} | |
| {'loss': '3.433', 'grad_norm': '0.9245', 'learning_rate': '0.0001283', 'epoch': '0.9237'} | |
| {'loss': '3.433', 'grad_norm': '0.836', 'learning_rate': '0.0001234', 'epoch': '0.9263'} | |
| {'loss': '3.439', 'grad_norm': '1.172', 'learning_rate': '0.0001184', 'epoch': '0.9289'} | |
| {'loss': '3.434', 'grad_norm': '0.8912', 'learning_rate': '0.0001136', 'epoch': '0.9315'} | |
| {'loss': '3.433', 'grad_norm': '0.829', 'learning_rate': '0.0001087', 'epoch': '0.9342'} | |
| {'loss': '3.435', 'grad_norm': '1.049', 'learning_rate': '0.0001039', 'epoch': '0.9368'} | |
| {'loss': '3.43', 'grad_norm': '0.9041', 'learning_rate': '9.92e-05', 'epoch': '0.9394'} | |
| {'loss': '3.432', 'grad_norm': '0.8179', 'learning_rate': '9.451e-05', 'epoch': '0.942'} | |
| {'loss': '3.437', 'grad_norm': '0.8509', 'learning_rate': '8.986e-05', 'epoch': '0.9447'} | |
| {'eval_loss': '3.438', 'eval_runtime': '4.859', 'eval_samples_per_second': '1005', 'eval_steps_per_second': '15.85', 'epoch': '0.9447'} | |
| {'loss': '3.43', 'grad_norm': '0.8434', 'learning_rate': '8.525e-05', 'epoch': '0.9473'} | |
| {'loss': '3.428', 'grad_norm': '0.8503', 'learning_rate': '8.068e-05', 'epoch': '0.9499'} | |
| {'loss': '3.428', 'grad_norm': '0.8723', 'learning_rate': '7.615e-05', 'epoch': '0.9525'} | |
| {'loss': '3.429', 'grad_norm': '0.8319', 'learning_rate': '7.166e-05', 'epoch': '0.9552'} | |
| {'loss': '3.432', 'grad_norm': '0.7774', 'learning_rate': '6.721e-05', 'epoch': '0.9578'} | |
| {'loss': '3.43', 'grad_norm': '0.9543', 'learning_rate': '6.28e-05', 'epoch': '0.9604'} | |
| {'loss': '3.431', 'grad_norm': '0.7796', 'learning_rate': '5.842e-05', 'epoch': '0.963'} | |
| {'loss': '3.425', 'grad_norm': '0.8253', 'learning_rate': '5.408e-05', 'epoch': '0.9657'} | |
| {'loss': '3.427', 'grad_norm': '0.7783', 'learning_rate': '4.977e-05', 'epoch': '0.9683'} | |
| {'loss': '3.423', 'grad_norm': '0.8057', 'learning_rate': '4.549e-05', 'epoch': '0.9709'} | |
| {'loss': '3.424', 'grad_norm': '0.8209', 'learning_rate': '4.125e-05', 'epoch': '0.9735'} | |
| {'loss': '3.423', 'grad_norm': '0.8969', 'learning_rate': '3.704e-05', 'epoch': '0.9761'} | |
| {'loss': '3.42', 'grad_norm': '0.759', 'learning_rate': '3.286e-05', 'epoch': '0.9788'} | |
| {'loss': '3.425', 'grad_norm': '0.7519', 'learning_rate': '2.871e-05', 'epoch': '0.9814'} | |
| {'loss': '3.422', 'grad_norm': '0.7159', 'learning_rate': '2.459e-05', 'epoch': '0.984'} | |
| {'loss': '3.421', 'grad_norm': '0.6734', 'learning_rate': '2.05e-05', 'epoch': '0.9866'} | |
| {'loss': '3.426', 'grad_norm': '0.7075', 'learning_rate': '1.644e-05', 'epoch': '0.9893'} | |
| {'loss': '3.421', 'grad_norm': '0.7579', 'learning_rate': '1.241e-05', 'epoch': '0.9919'} | |
| {'loss': '3.42', 'grad_norm': '1.06', 'learning_rate': '8.403e-06', 'epoch': '0.9945'} | |
| {'loss': '3.418', 'grad_norm': '0.7073', 'learning_rate': '4.425e-06', 'epoch': '0.9971'} | |
| {'eval_loss': '3.428', 'eval_runtime': '4.895', 'eval_samples_per_second': '997.3', 'eval_steps_per_second': '15.73', 'epoch': '0.9971'} | |
| {'loss': '3.419', 'grad_norm': '0.6727', 'learning_rate': '4.725e-07', 'epoch': '0.9998'} | |
| {'eval_loss': '3.428', 'eval_runtime': '4.859', 'eval_samples_per_second': '1005', 'eval_steps_per_second': '15.85', 'epoch': '1'} | |
| Writing model shards: 100%|βββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββ| 1/1 [00:00<00:00, 270.11it/s] | |
| {'train_runtime': '1.356e+04', 'train_samples_per_second': '359.8', 'train_steps_per_second': '1.406', 'train_loss': '3.79', 'epoch': '1'} | |
| 100%|ββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββ| 19055/19055 [3:45:57<00:00, 1.41it/s] | |
| Writing model shards: 100%|βββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββ| 1/1 [00:00<00:00, 322.34it/s] | |
| [*] done |