Instructions to use Jeesup/llama32-3B-rte-bf16-lora-seed42 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use Jeesup/llama32-3B-rte-bf16-lora-seed42 with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("meta-llama/Llama-3.2-3B") model = PeftModel.from_pretrained(base_model, "Jeesup/llama32-3B-rte-bf16-lora-seed42") - Notebooks
- Google Colab
- Kaggle
| { | |
| "run_name": "llama32-3B-rte-bf16-lora-seed42", | |
| "model_size": "3B", | |
| "model_id": "meta-llama/Llama-3.2-3B", | |
| "task": "rte", | |
| "glue_config": "rte", | |
| "n_classes": 2, | |
| "bitwidth": "bf16", | |
| "seed": 42, | |
| "lora_init_source": "shared:lora_init_3B_seed42.pt:224tensors", | |
| "trainable_params": 9175040, | |
| "total_params": 3221924864, | |
| "train": { | |
| "steps": 105, | |
| "epochs": 2.9411764705882355, | |
| "train_runtime_sec": 225.48081922531128, | |
| "train_loss": 0.4097530353636969, | |
| "n_train_examples": 2241, | |
| "n_train_tokens_per_epoch": 219447, | |
| "throughput_samples_per_sec": 29.231650360477072, | |
| "throughput_tokens_per_sec": 2862.4712077892063 | |
| }, | |
| "peak_gpu_mem_gib": { | |
| "allocated": 7.778398513793945, | |
| "reserved": 12.90234375 | |
| }, | |
| "validation": { | |
| "accuracy": 0.8755020080321285, | |
| "macro_f1": 0.8754698717431637, | |
| "loss": 0.32502645490519017, | |
| "n": 249, | |
| "n_classes": 2, | |
| "majority_baseline": 0.5140562248995983, | |
| "pred_dist": { | |
| "A": 124, | |
| "B": 125 | |
| }, | |
| "true_dist": { | |
| "A": 121, | |
| "B": 128 | |
| } | |
| }, | |
| "test": { | |
| "accuracy": 0.8303249097472925, | |
| "macro_f1": 0.8300058758242475, | |
| "loss": 0.388077862426262, | |
| "n": 277, | |
| "n_classes": 2, | |
| "majority_baseline": 0.5270758122743683, | |
| "pred_dist": { | |
| "A": 143, | |
| "B": 134 | |
| }, | |
| "true_dist": { | |
| "A": 146, | |
| "B": 131 | |
| } | |
| }, | |
| "hyperparams": { | |
| "num_train_epochs": 3, | |
| "learning_rate": 0.0002, | |
| "max_length": 256, | |
| "per_device_train_batch_size": 4, | |
| "per_device_eval_batch_size": 8, | |
| "gradient_accumulation_steps": 16, | |
| "warmup_ratio": 0.03, | |
| "lr_scheduler_type": "cosine", | |
| "gradient_checkpointing": true | |
| }, | |
| "lora": { | |
| "r": 16, | |
| "alpha": 32, | |
| "dropout": 0.0, | |
| "bias": "none", | |
| "target_modules": [ | |
| "q_proj", | |
| "k_proj", | |
| "v_proj", | |
| "o_proj" | |
| ] | |
| }, | |
| "env": { | |
| "torch": "2.4.1+cu121", | |
| "cuda": "12.1", | |
| "gpu": "NVIDIA GeForce RTX 4090", | |
| "slurm_job": "1932445", | |
| "node": "node39" | |
| }, | |
| "debug_caps": { | |
| "max_train": null, | |
| "max_eval": null, | |
| "max_steps": -1 | |
| } | |
| } |