Instructions to use tbkhiem/shinelm-gguf with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use tbkhiem/shinelm-gguf with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-generation", model="tbkhiem/shinelm-gguf")# Load model directly from transformers import AutoModel model = AutoModel.from_pretrained("tbkhiem/shinelm-gguf", device_map="auto") - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- llama.cpp
How to use tbkhiem/shinelm-gguf with llama.cpp:
Install (macOS, Linux)
curl -LsSf https://llama.app/install.sh | sh # Start a local OpenAI-compatible server with a web UI: llama serve -hf tbkhiem/shinelm-gguf:Q4_K_M # Run inference directly in the terminal: llama cli -hf tbkhiem/shinelm-gguf:Q4_K_M
Install from WinGet (Windows)
winget install llama.cpp # Start a local OpenAI-compatible server with a web UI: llama serve -hf tbkhiem/shinelm-gguf:Q4_K_M # Run inference directly in the terminal: llama cli -hf tbkhiem/shinelm-gguf:Q4_K_M
Use pre-built binary
# Download pre-built binary from: # https://github.com/ggerganov/llama.cpp/releases # Start a local OpenAI-compatible server with a web UI: ./llama-server -hf tbkhiem/shinelm-gguf:Q4_K_M # Run inference directly in the terminal: ./llama-cli -hf tbkhiem/shinelm-gguf:Q4_K_M
Build from source code
git clone https://github.com/ggerganov/llama.cpp.git cd llama.cpp cmake -B build cmake --build build -j --target llama-server llama-cli # Start a local OpenAI-compatible server with a web UI: ./build/bin/llama-server -hf tbkhiem/shinelm-gguf:Q4_K_M # Run inference directly in the terminal: ./build/bin/llama-cli -hf tbkhiem/shinelm-gguf:Q4_K_M
Use Docker
docker model run hf.co/tbkhiem/shinelm-gguf:Q4_K_M
- LM Studio
- Jan
- vLLM
How to use tbkhiem/shinelm-gguf with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "tbkhiem/shinelm-gguf" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "tbkhiem/shinelm-gguf", "prompt": "Once upon a time,", "max_tokens": 512, "temperature": 0.5 }'Use Docker
docker model run hf.co/tbkhiem/shinelm-gguf:Q4_K_M
- SGLang
How to use tbkhiem/shinelm-gguf with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "tbkhiem/shinelm-gguf" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "tbkhiem/shinelm-gguf", "prompt": "Once upon a time,", "max_tokens": 512, "temperature": 0.5 }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "tbkhiem/shinelm-gguf" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "tbkhiem/shinelm-gguf", "prompt": "Once upon a time,", "max_tokens": 512, "temperature": 0.5 }' - Ollama
How to use tbkhiem/shinelm-gguf with Ollama:
ollama run hf.co/tbkhiem/shinelm-gguf:Q4_K_M
- Unsloth Studio
How to use tbkhiem/shinelm-gguf with Unsloth Studio:
Install Unsloth Studio (macOS, Linux, WSL)
curl -fsSL https://unsloth.ai/install.sh | sh # Run unsloth studio unsloth studio -H 0.0.0.0 -p 8888 # Then open http://localhost:8888 in your browser # Search for tbkhiem/shinelm-gguf to start chatting
Install Unsloth Studio (Windows)
irm https://unsloth.ai/install.ps1 | iex # Run unsloth studio unsloth studio -H 0.0.0.0 -p 8888 # Then open http://localhost:8888 in your browser # Search for tbkhiem/shinelm-gguf to start chatting
Using HuggingFace Spaces for Unsloth
# No setup required # Open https://huggingface.co/spaces/unsloth/studio in your browser # Search for tbkhiem/shinelm-gguf to start chatting
- Docker Model Runner
How to use tbkhiem/shinelm-gguf with Docker Model Runner:
docker model run hf.co/tbkhiem/shinelm-gguf:Q4_K_M
- Lemonade
How to use tbkhiem/shinelm-gguf with Lemonade:
Pull the model
# Download Lemonade from https://lemonade-server.ai/ lemonade pull tbkhiem/shinelm-gguf:Q4_K_M
Run and chat with the model
lemonade run user.shinelm-gguf-Q4_K_M
List all available models
lemonade list
- Atomic Chat
- ShineLM
- Model Details
- Intended Use
- Bias, Risks, and Limitations
- How to Get Started
- Training Details
- Evaluation
- Model Examination
- Environmental Impact
- Technical Specifications
- Citation
- Glossary
- More Information
- Model Card Authors
- Model Card Contact
- https://huggingface.co/tbkhiem/shinelm-gguf
- Acknowledgements
ShineLM
ShineLM (Shine Learning Model) là mô hình ngôn ngữ được nghiên cứu và phát triển cho hệ sinh thái ShineAI – Hệ thống học tập cá nhân hóa cho trẻ em, tập trung vào các tình huống giáo dục và hỗ trợ học tập, đặc biệt hướng đến trẻ có nhu cầu hỗ trợ trong các lĩnh vực như ASD và ADHD.
ShineLM được fine-tune từ mô hình nền Google Gemma 4 E2B-it bằng kỹ thuật LoRA/QLoRA, sử dụng dữ liệu giáo dục chuyên biệt được xây dựng cho ShineAI.
Phiên bản được công bố tại repository này là GGUF Q4_K_M, có kích thước khoảng 3,43 GB, được tối ưu để triển khai suy luận cục bộ bằng Ollama.
Model Details
Model Description
- Developed by: Nhóm phát triển ShineAI
- Shared by:
tbkhiem - Model type: Fine-tuned language model based on Gemma 4 E2B-it
- Language(s): Vietnamese
- License: Gemma license / terms of use inherited from the base model
- Finetuned from model:
google/gemma-4-E2B-it - Model format: GGUF
- Quantization: Q4_K_M (4-bit)
- Model size: Approximately 3.43 GB
- Primary deployment: Local inference with Ollama
ShineLM được xây dựng nhằm hiểu tốt hơn các ngữ cảnh dữ liệu học tập của ShineAI, đặc biệt là kết quả luyện tập, nhóm kỹ năng và nhu cầu cá nhân hóa nội dung học tập.
Mục tiêu chính là tạo ra một mô hình nhỏ gọn, có thể chạy cục bộ, giảm sự phụ thuộc vào các API AI thương mại và hỗ trợ bảo vệ dữ liệu học tập khi triển khai tại máy người dùng.
Model Sources
- Repository: https://huggingface.co/tbkhiem/shinelm-gguf
- Base model: https://huggingface.co/google/gemma-4-E2B-it
- Deployment: Ollama
- Project: ShineAI
Intended Use
Direct Use
ShineLM được thiết kế chủ yếu cho các chức năng AI trong hệ sinh thái ShineAI:
- Phân tích kết quả học tập.
- Đánh giá điểm mạnh và điểm cần cải thiện.
- Sinh nhận xét và lời động viên học tập bằng tiếng Việt.
- Gợi ý bài học tiếp theo phù hợp với kết quả học tập.
- Hỗ trợ xây dựng lộ trình học tập.
- Hỗ trợ trò chuyện AI trong môi trường giáo dục.
- Hỗ trợ giáo viên và phụ huynh thông qua báo cáo và khuyến nghị AI.
Mô hình đặc biệt hướng tới các tình huống giáo dục dành cho trẻ em và các nội dung hỗ trợ cá nhân hóa học tập.
Downstream Use
ShineLM có thể được tích hợp vào các ứng dụng giáo dục có khả năng chạy mô hình GGUF thông qua Ollama hoặc các công cụ suy luận tương thích.
Một kiến trúc triển khai điển hình trong ShineAI:
ReactJS Frontend
│
▼
NestJS Backend
│
▼
Ollama
│
▼
ShineLM
Mô hình cũng có thể được sử dụng như một thành phần AI cục bộ trong các hệ thống giáo dục cần hạn chế việc gửi dữ liệu học tập lên các API AI bên thứ ba.
Out-of-Scope Use
ShineLM không phải là:
- Công cụ chẩn đoán ASD, ADHD hoặc bất kỳ tình trạng y khoa nào.
- Công cụ thay thế giáo viên, chuyên gia giáo dục hoặc chuyên gia y tế.
- Công cụ dùng để đưa ra quyết định y tế, tâm lý hoặc chẩn đoán lâm sàng.
- Hệ thống đánh giá năng lực chính thức hoặc công cụ quyết định kết quả học tập của học sinh.
- Mô hình được thiết kế để xử lý các tác vụ ngoài phạm vi giáo dục mà không có kiểm thử phù hợp.
Các kết quả do mô hình sinh ra cần được xem là gợi ý của AI, không phải kết luận chuyên môn.
Bias, Risks, and Limitations
ShineLM được fine-tune trên dữ liệu giáo dục chuyên biệt do nhóm phát triển xây dựng, bao gồm dữ liệu tổng hợp và dữ liệu được mở rộng từ các mẫu giáo dục.
Dữ liệu fine-tune cuối cùng gồm:
- 9.996 mẫu hợp lệ.
- 9.496 mẫu huấn luyện.
- 500 mẫu đánh giá.
- Tỷ lệ train/evaluation: 95% / 5%.
Dữ liệu chủ yếu tập trung vào các tình huống nhận xét, động viên và phản hồi giáo dục. Vì vậy, mô hình không nên được xem là một mô hình ngôn ngữ đa mục đích có khả năng tương đương các mô hình nền hoặc các mô hình thương mại lớn.
Các hạn chế có thể bao gồm:
- Có thể sinh thông tin không chính xác hoặc không phù hợp với ngữ cảnh.
- Có thể lặp lại các mẫu diễn đạt đã xuất hiện trong dữ liệu huấn luyện.
- Có thể không xử lý tốt các tình huống giáo dục nằm ngoài phạm vi dữ liệu fine-tune.
- Chưa có đánh giá benchmark định lượng toàn diện trên nhiều bộ dữ liệu độc lập.
- Training loss không phải là thước đo duy nhất để xác định chất lượng thực tế của mô hình.
Recommendations
Khi sử dụng ShineLM trong môi trường giáo dục:
- Xem kết quả của mô hình là thông tin hỗ trợ, không phải kết luận chuyên môn.
- Giáo viên hoặc phụ huynh nên kiểm tra các phản hồi quan trọng trước khi sử dụng.
- Không sử dụng mô hình cho mục đích chẩn đoán y tế hoặc tâm lý.
- Nên kiểm thử mô hình trên dữ liệu thực tế của từng môi trường trước khi triển khai rộng.
- Khi sử dụng với trẻ em, cần đặc biệt chú ý đến quyền riêng tư và bảo vệ dữ liệu cá nhân.
How to Get Started
Run with Ollama
ShineLM có thể được chạy trực tiếp bằng Ollama:
ollama run hf.co/tbkhiem/shinelm-gguf:Q4_K_M
Sau khi khởi động, Ollama cung cấp local inference API để các ứng dụng khác có thể gọi tới mô hình.
Example
ollama run hf.co/tbkhiem/shinelm-gguf:Q4_K_M
Sau đó có thể nhập yêu cầu bằng tiếng Việt, ví dụ:
Dựa trên kết quả học tập của học sinh:
- Bài Tập trung 10 phút: đúng 4/5
- Bài Nhận biết cảm xúc: đúng 5/5
- Bài Làm theo hướng dẫn: đúng 3/5
Hãy đưa ra nhận xét ngắn gọn và tích cực cho học sinh.
Training Details
Training Data
Dữ liệu ShineLM được xây dựng theo nhiều giai đoạn.
Theo hồ sơ dự án, bộ dữ liệu được xây dựng với khoảng 10.000–10.100 mẫu dữ liệu giáo dục chuyên biệt, gồm:
- Các mẫu dữ liệu giáo dục được tổng hợp từ tài liệu, nghiên cứu và học liệu công khai liên quan đến giáo dục trẻ ASD và ADHD.
- Dữ liệu mở rộng bằng phương pháp Data Augmentation.
- Dữ liệu tình huống được sinh tổng hợp (Synthetic Dataset).
- Dữ liệu được xây dựng theo các kịch bản học tập, hành vi và phản hồi giáo dục.
- Dữ liệu cho phân hệ gợi ý bài học tiếp theo được xây dựng bằng phương pháp rule-based synthetic data generation.
Bộ dữ liệu dùng trực tiếp cho lần fine-tune được chuẩn hóa thành:
shinelm_dataset_10000.jsonl
Sau khi lọc các mẫu lỗi định dạng hoặc thiếu nội dung:
- 9.996 mẫu hợp lệ
- 9.496 mẫu training
- 500 mẫu evaluation
Dữ liệu được chuyển sang định dạng hội thoại user-assistant theo chat template của Gemma.
Training Procedure
ShineLM được fine-tune bằng LoRA/QLoRA trên nền tảng Kaggle Notebook, sử dụng GPU Tesla T4.
Các công cụ chính:
- Unsloth
- Hugging Face Transformers
- Hugging Face Datasets
- PEFT
- TRL / SFTTrainer
- Bitsandbytes
- Accelerate
Preprocessing
Dữ liệu được:
- Lọc các mẫu lỗi hoặc thiếu nội dung.
- Chuẩn hóa thành cấu trúc hội thoại
user-assistant. - Áp dụng chat template của Gemma.
- Tokenize bằng tokenizer của mô hình nền.
- Shuffle với
seed = 42. - Chia thành training/evaluation theo tỷ lệ 95/5.
Training Hyperparameters
- Base model:
google/gemma-4-E2B-it - Training method: LoRA / QLoRA
- LoRA rank: 16
- LoRA alpha: 16
- LoRA dropout: 0
- Target modules:
q_proj,k_proj,v_proj,o_proj,gate_proj,up_proj,down_proj - Trainable parameters: 25,337,856 / 5,148,515,872 (~0.49%)
- Epochs: 1
- Batch size: 8
- Gradient accumulation: 2
- Effective batch size: 16
- Learning rate: 1e-4
- Warm-up steps: 20
- Optimizer: AdamW 8-bit
- Maximum sequence length: 1024 tokens
- Compute precision: float32
- Gradient checkpointing: Unsloth
Learning rate và số epoch được giảm so với cấu hình thử nghiệm ban đầu nhằm hạn chế nguy cơ overfitting trên dữ liệu có nhiều mẫu nhận xét ngắn.
Training Results
- Training steps: 594
- Epochs: 1
- Final training loss: 0.1757
- Training time: approximately 2,141 seconds (~35.7 minutes)
- Processing speed: approximately 4.44 samples/second
- Total FLOPs: approximately 2.48 × 10¹⁶
- Training hardware: NVIDIA Tesla T4
Training loss được sử dụng như một chỉ số theo dõi quá trình huấn luyện, không phải là chỉ số duy nhất để khẳng định chất lượng mô hình.
Evaluation
Testing Data
Tập evaluation gồm 500 mẫu, được tách từ bộ dữ liệu 9.996 mẫu hợp lệ theo tỷ lệ 95/5.
Ngoài evaluation dataset, mô hình được kiểm thử định tính bằng nhiều tình huống mô phỏng:
- Kết quả học tập tốt.
- Kết quả học tập chưa tốt.
- Nhiều bài học trong cùng một lượt.
- Kết quả gần như tuyệt đối.
- Các tình huống yêu cầu nhận xét và động viên phù hợp với kết quả.
Factors
Các yếu tố được quan sát trong quá trình kiểm thử gồm:
- Khả năng hiểu cấu trúc dữ liệu học tập.
- Khả năng nhận biết kết quả tốt và chưa tốt.
- Khả năng sinh nhận xét phù hợp với kết quả.
- Khả năng tạo lời động viên tích cực.
- Mức độ phù hợp với ngữ cảnh giáo dục trẻ em.
Metrics
Hiện tại dự án chưa công bố một bộ benchmark định lượng độc lập hoặc một metric chuẩn hóa để so sánh ShineLM với các mô hình khác.
Chỉ số được ghi nhận trong quá trình training là:
Final training loss = 0.1757
Training loss không được sử dụng như thước đo duy nhất cho chất lượng mô hình.
Results
Kết quả thực nghiệm cho thấy ShineLM có khả năng:
- Hiểu cấu trúc dữ liệu học tập của ShineAI.
- Nhận biết bài học, nhóm kỹ năng và kết quả luyện tập.
- Sinh nhận xét và lời động viên bằng tiếng Việt.
- Hỗ trợ phân tích kết quả học tập.
- Hỗ trợ gợi ý bài học.
- Hỗ trợ xây dựng lộ trình học tập.
- Hỗ trợ hội thoại AI trong hệ thống ShineAI.
Summary
ShineLM đạt mục tiêu xây dựng một mô hình AI giáo dục chuyên biệt có thể triển khai cục bộ.
Mô hình đã được fine-tune thành công từ Gemma 4 E2B-it bằng LoRA/QLoRA, lượng tử hóa sang GGUF Q4_K_M và công bố dưới dạng mô hình hoàn chỉnh trên Hugging Face.
Model Examination
ShineLM được phát triển theo quy trình:
Educational Dataset
│
▼
Data Preprocessing
│
▼
Gemma 4 E2B-it
│
▼
LoRA / QLoRA Fine-tuning
│
▼
Fine-tuned Model
│
▼
GGUF Q4_K_M
│
▼
Ollama
│
▼
ShineAI
LoRA adapter ban đầu có kích thước khoảng 50.7 MB, trong khi phiên bản ShineLM hoàn chỉnh GGUF Q4_K_M được công bố có kích thước khoảng 3.43 GB.
Việc tách adapter khỏi mô hình nền trong quá trình phát triển cũng giúp thuận tiện cho việc cập nhật các phiên bản fine-tune trong tương lai.
Environmental Impact
Hiện dự án chưa thực hiện đo lường hoặc công bố lượng phát thải CO₂ trong quá trình huấn luyện.
- Hardware Type: NVIDIA Tesla T4
- Hours used: Approximately 0.6 hours for the reported training run
- Cloud Provider: Kaggle
- Compute Region: Not reported
- Carbon Emitted: Not measured
Technical Specifications
Model Architecture and Objective
- Architecture: Gemma 4
- Base model:
google/gemma-4-E2B-it - Fine-tuning: LoRA / QLoRA
- LoRA rank: 16
- LoRA alpha: 16
- Quantization: Q4_K_M
- Format: GGUF
- Primary language: Vietnamese
- Primary objective: Educational text generation and personalized learning assistance
Compute Infrastructure
Training was performed using Kaggle Notebook with an NVIDIA Tesla T4 GPU.
Hardware
For inference, ShineLM is designed for local deployment and can run through Ollama on systems using CPU or GPU depending on the available hardware.
Because the published Q4_K_M model is approximately 3.43 GB, sufficient RAM/VRAM and storage should be available for practical inference.
Software
Recommended software:
- Ollama
- GGUF-compatible inference software
- llama.cpp-compatible runtimes
The model was developed using:
- Python
- Hugging Face Transformers
- Hugging Face Datasets
- PEFT
- TRL
- Unsloth
- Bitsandbytes
- Accelerate
Citation
If you use ShineLM in a project, research work, demonstration, or educational application, please reference the model repository:
ShineLM (Shine Learning Model).
Fine-tuned Gemma 4 E2B-it model for personalized educational support.
Hugging Face: https://huggingface.co/tbkhiem/shinelm-gguf
BibTeX
@misc{shinelm2026,
title = {ShineLM: Shine Learning Model},
author = {ShineAI Development Team},
year = {2026},
publisher = {Hugging Face},
url = {https://huggingface.co/tbkhiem/shinelm-gguf},
note = {Fine-tuned Gemma 4 E2B-it model in GGUF Q4_K_M format}
}
Glossary
- ShineLM: Shine Learning Model.
- ShineAI: Hệ thống học tập cá nhân hóa sử dụng AI.
- LoRA: Low-Rank Adaptation, kỹ thuật fine-tuning hiệu quả về tài nguyên.
- QLoRA: Kỹ thuật kết hợp quantization và LoRA để giảm yêu cầu bộ nhớ khi fine-tuning.
- GGUF: Định dạng mô hình được sử dụng phổ biến cho suy luận cục bộ.
- Q4_K_M: Phương pháp lượng tử hóa 4-bit được sử dụng cho phiên bản công bố.
- Ollama: Nền tảng hỗ trợ chạy mô hình ngôn ngữ cục bộ.
- ASD: Autism Spectrum Disorder.
- ADHD: Attention-Deficit/Hyperactivity Disorder.
- SFT: Supervised Fine-Tuning.
More Information
ShineLM là một thành phần của hệ sinh thái ShineAI, được phát triển trong khuôn khổ đề tài:
ShineAI – Hệ thống học tập cá nhân hóa cho trẻ em đặc biệt ứng dụng mô hình AI chuyên biệt ShineLM.
ShineLM được phát triển với định hướng:
- Cá nhân hóa học tập.
- Hỗ trợ giáo viên và phụ huynh.
- Sinh nhận xét học tập bằng tiếng Việt.
- Gợi ý bài học phù hợp.
- Hỗ trợ lộ trình học tập.
- Triển khai AI cục bộ.
- Giảm phụ thuộc vào các API AI thương mại.
- Tạo nền tảng nghiên cứu và phát triển trợ lý AI giáo dục tiếng Việt.
Model Card Authors
ShineAI Development Team
Model Card Contact
Hugging Face: tbkhiem
Model repository:
https://huggingface.co/tbkhiem/shinelm-gguf
Acknowledgements
ShineLM được xây dựng dựa trên mô hình nền Gemma 4 E2B-it và sử dụng các công cụ mã nguồn mở trong hệ sinh thái Hugging Face, Unsloth, TRL, PEFT và Ollama.
Người dùng cần tuân thủ các điều khoản sử dụng và giấy phép của mô hình nền khi sử dụng hoặc phân phối ShineLM.
- Downloads last month
- 98
4-bit
docker model run hf.co/tbkhiem/shinelm-gguf:Q4_K_M