mozilla-foundation/common_voice_17_0
Updated • 4.31k • 37
A multimodal speech-language model that can understand Ukrainian speech and respond intelligently.
import torch
from transformers import AutoProcessor, AutoModel
import librosa
model_id = "roman4work/ultravox-v0.6-gemma-3-12b-uk"
processor = AutoProcessor.from_pretrained(model_id, trust_remote_code=True)
model = AutoModel.from_pretrained(model_id, trust_remote_code=True, torch_dtype=torch.bfloat16, device_map="cuda")
audio, sr = librosa.load("audio.wav", sr=16000)
# Transcription mode
messages = [{"role": "user", "content": "Repeat the following text, without any explanation: <|audio|>"}]
# OR Conversation mode: messages = [{"role": "user", "content": "<|audio|>"}]
text = processor.tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
inputs = processor(text=text, audio=audio, sampling_rate=16000, return_tensors="pt")
inputs = {k: v.to("cuda") if hasattr(v, "to") else v for k, v in inputs.items()}
with torch.no_grad():
outputs = model.generate(**inputs, max_new_tokens=256)
print(processor.tokenizer.decode(outputs[0][inputs["input_ids"].shape[1]:], skip_special_tokens=True))
| Mode | Prompt | Result |
|---|---|---|
| Transcription | `Repeat the following text, without any explanation: < | audio |
| Conversation | `< | audio |
Apache 2.0