RestoreKV-Llama-3.1-8B-Instruct_plus

PEFT LoRA adapter + restore-token embeddings for RestoreKV (paper), a budget-matched, single-pass plug-in that recovers full-cache behavior under aggressive KV cache eviction on top of KVzip.

  • Base model: meta-llama/Llama-3.1-8B-Instruct — base scorer: KVzip+
  • adapter_model.safetensors: rank-8 LoRA (α=16) on q/k/v/o/gate/up/down proj
  • restore_embeddings.safetensors: 8 learned restore-token embeddings

Load via the RestoreKVPress in NVIDIA/kvpress.

License

CC BY-NC 4.0 (distilled with LongAlpaca-derived data; research / non-commercial).

Downloads last month
-
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for higokri/RestoreKV-Llama-3.1-8B-Instruct_plus

Adapter
(2739)
this model

Collection including higokri/RestoreKV-Llama-3.1-8B-Instruct_plus

Paper for higokri/RestoreKV-Llama-3.1-8B-Instruct_plus