octava/indonesian-voice-transcription-1.1.85
Viewer • Updated • 27k • 18 • 4
How to use Ellbendls/csm-1b-indonesian-fine-tuned with Transformers:
# Use a pipeline as a high-level helper
from transformers import pipeline
pipe = pipeline("text-to-speech", model="Ellbendls/csm-1b-indonesian-fine-tuned") # Load model directly
from transformers import AutoModel
model = AutoModel.from_pretrained("Ellbendls/csm-1b-indonesian-fine-tuned", device_map="auto")How to use Ellbendls/csm-1b-indonesian-fine-tuned with Unsloth Studio:
curl -fsSL https://unsloth.ai/install.sh | sh # Run unsloth studio unsloth studio -H 0.0.0.0 -p 8888 # Then open http://localhost:8888 in your browser # Search for Ellbendls/csm-1b-indonesian-fine-tuned to start chatting
irm https://unsloth.ai/install.ps1 | iex # Run unsloth studio unsloth studio -H 0.0.0.0 -p 8888 # Then open http://localhost:8888 in your browser # Search for Ellbendls/csm-1b-indonesian-fine-tuned to start chatting
# No setup required # Open https://huggingface.co/spaces/unsloth/studio in your browser # Search for Ellbendls/csm-1b-indonesian-fine-tuned to start chatting
pip install unsloth
from unsloth import FastModel
model, tokenizer = FastModel.from_pretrained(
model_name="Ellbendls/csm-1b-indonesian-fine-tuned",
max_seq_length=2048,
)This is a fine-tuned CSM (Conversational Speech Model) for Indonesian Text-to-Speech (TTS) generation. The model has been adapted from the original CSM-1B to generate natural-sounding Indonesian speech from text input.
Key Features:
This CSM model was trained 2x faster with Unsloth and Huggingface's TRL library.
pip install transformers torch soundfile ipython
from transformers import CsmForConditionalGeneration, AutoProcessor
import torch
from IPython.display import Audio, display
import soundfile as sf
# Load model dan processor
model = CsmForConditionalGeneration.from_pretrained("Ellbendls/csm-1b-indonesian-fine-tuned")
processor = AutoProcessor.from_pretrained("Ellbendls/csm-1b-indonesian-fine-tuned")
# Move to GPU if available
device = "cuda" if torch.cuda.is_available() else "cpu"
model = model.to(device)
# Generate audio
text = "Selamat pagi, nama saya adalah Budi. Bagaimana kabar Anda hari ini?"
speaker_id = 0 # Use speaker ID 0-80
inputs = processor(f"[{speaker_id}]{text}", add_special_tokens=True).to(device)
audio_values = model.generate(
**inputs,
max_new_tokens=125, # ~10 seconds of audio
output_audio=True
)
# Convert and save audio
audio = audio_values[0].to(torch.float32).cpu().numpy()
sf.write("indonesian_tts_output.wav", audio, 24000)
display(Audio(audio, rate=24000))
# Generate with custom parameters for better quality
audio_values = model.generate(
**inputs,
max_new_tokens=200, # For longer text
depth_decoder_top_p=0.9,
depth_decoder_do_sample=True,
depth_decoder_temperature=0.9,
output_audio=True
)
@model{csm-1b-indonesian-fine-tuned,
title={CSM-1B Indonesian Fine-tuned TTS Model},
author={Ellbendls},
year={2025},
base_model={unsloth/csm-1b},
dataset={octava/indonesian-voice-transcription-1.1.85}
}