RestoreKV
Collection
PEFT LoRA adapters for RestoreKV (arXiv:2608.01247): budget-matched learned restoration on top of KVzip. • 4 items • Updated
How to use higokri/RestoreKV-Llama-3.1-8B-Instruct_plus with PEFT:
from peft import PeftModel
from transformers import AutoModelForCausalLM
base_model = AutoModelForCausalLM.from_pretrained("meta-llama/Llama-3.1-8B-Instruct")
model = PeftModel.from_pretrained(base_model, "higokri/RestoreKV-Llama-3.1-8B-Instruct_plus")PEFT LoRA adapter + restore-token embeddings for RestoreKV (paper), a budget-matched, single-pass plug-in that recovers full-cache behavior under aggressive KV cache eviction on top of KVzip.
meta-llama/Llama-3.1-8B-Instruct — base scorer: KVzip+adapter_model.safetensors: rank-8 LoRA (α=16) on q/k/v/o/gate/up/down projrestore_embeddings.safetensors: 8 learned restore-token embeddingsLoad via the RestoreKVPress in NVIDIA/kvpress.
CC BY-NC 4.0 (distilled with LongAlpaca-derived data; research / non-commercial).
Base model
meta-llama/Llama-3.1-8B