Text Generation
Transformers
GGUF
nvidia
unsloth
imatrix
conversational

How to run any of the quantized versions ?

#10
by gimli84 - opened

Hi

I've tried to run

Nemotron-3-Nano-30B-A3B-Q4_K_M.gguf

I downloaded file locally and run

import torch
from transformers import AutoTokenizer, AutoModelForCausalLM

GGUF_FILENAME = "Nemotron-3-Nano-30B-A3B-Q4_K_M.gguf"
# Load tokenizer and model
tokenizer = AutoTokenizer.from_pretrained("nvidia/NVIDIA-Nemotron-3-Nano-30B-A3B-BF16")

model = AutoModelForCausalLM.from_pretrained(
    ".",                              # Look in current directory
    gguf_file=GGUF_FILENAME,          # Specific GGUF filename
    torch_dtype=torch.bfloat16,
    trust_remote_code=True,
    device_map="auto"
)

messages = [
    {"role": "user", "content": "Write a haiku about GPUs"},
]

tokenized_chat = tokenizer.apply_chat_template(
    messages,
    tokenize=True,
    add_generation_prompt=True,
    return_tensors="pt"
).to(model.device)

outputs = model.generate(
    tokenized_chat,
    max_new_tokens=1024,
    temperature=1.0,
    top_p=1.0,
    eos_token_id=tokenizer.eos_token_id
)
print(tokenizer.decode(outputs[0]))

It end up with an error:

import torch
from transformers import AutoTokenizer, AutoModelForCausalLM

GGUF_FILENAME = "Nemotron-3-Nano-30B-A3B-Q4_K_M.gguf"
# Load tokenizer and model
tokenizer = AutoTokenizer.from_pretrained("nvidia/NVIDIA-Nemotron-3-Nano-30B-A3B-BF16")

model = AutoModelForCausalLM.from_pretrained(
    ".",                              # Look in current directory
    gguf_file=GGUF_FILENAME,          # Specific GGUF filename
    torch_dtype=torch.bfloat16,
    trust_remote_code=True,
    device_map="auto"
)

messages = [
    {"role": "user", "content": "Write a haiku about GPUs"},
]

tokenized_chat = tokenizer.apply_chat_template(
    messages,
    tokenize=True,
    add_generation_prompt=True,
    return_tensors="pt"
).to(model.device)

outputs = model.generate(
    tokenized_chat,
    max_new_tokens=1024,
    temperature=1.0,
    top_p=1.0,
    eos_token_id=tokenizer.eos_token_id
)
print(tokenizer.decode(outputs[0]))

how I should do this ? Can you please update Readme.md with details ?

Thanks in advance.

The file format .gguf was created by the llama.cpp project:
https://github.com/ggml-org/llama.cpp

Please ask your helpful LLM for further advice about this project and the .gguf file format.

Sign up or log in to comment