Instructions to use TilQazyna/Til-1B-multilingual-base-GEC with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use TilQazyna/Til-1B-multilingual-base-GEC with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-generation", model="TilQazyna/Til-1B-multilingual-base-GEC")# Load model directly from transformers import AutoTokenizer, AutoModelForCausalLM tokenizer = AutoTokenizer.from_pretrained("TilQazyna/Til-1B-multilingual-base-GEC") model = AutoModelForCausalLM.from_pretrained("TilQazyna/Til-1B-multilingual-base-GEC", device_map="auto") - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use TilQazyna/Til-1B-multilingual-base-GEC with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "TilQazyna/Til-1B-multilingual-base-GEC" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "TilQazyna/Til-1B-multilingual-base-GEC", "prompt": "Once upon a time,", "max_tokens": 512, "temperature": 0.5 }'Use Docker
docker model run hf.co/TilQazyna/Til-1B-multilingual-base-GEC
- SGLang
How to use TilQazyna/Til-1B-multilingual-base-GEC with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "TilQazyna/Til-1B-multilingual-base-GEC" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "TilQazyna/Til-1B-multilingual-base-GEC", "prompt": "Once upon a time,", "max_tokens": 512, "temperature": 0.5 }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "TilQazyna/Til-1B-multilingual-base-GEC" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "TilQazyna/Til-1B-multilingual-base-GEC", "prompt": "Once upon a time,", "max_tokens": 512, "temperature": 0.5 }' - Docker Model Runner
How to use TilQazyna/Til-1B-multilingual-base-GEC with Docker Model Runner:
docker model run hf.co/TilQazyna/Til-1B-multilingual-base-GEC
You need to agree to share your contact information to access this model
This repository is publicly accessible, but you have to accept the conditions to access its files and content.
Бұл репозиторийге қолжетімділік өтінім бойынша беріледі. Өзіңіз туралы және деректерді қалай қолданатыңыз туралы жазыңыз — өтінімді TilQazyna командасы қарайды. · Доступ к репозиторию выдаётся по заявке. Расскажите о себе и о том, как собираетесь использовать данные — заявку рассматривает команда TilQazyna. · Access to this repository is granted on request. Tell us who you are and how you plan to use the material; the TilQazyna team reviews each application.
Log in or Sign Up to review the conditions and access this model content.
Til-1B-multilingual-base-GEC
Қазақ мәтініндегі қатені түзету · Исправление ошибок в казахском тексте · Kazakh grammatical error correction
Қазақша
Til-1B-multilingual-base-GEC — қазақ сөйлемдеріндегі грамматикалық және емле қателерін түзететін 941M параметрлі модель. Репозиторий көлемі — 1.89 ГБ. Ол Til-1B-multilingual-base негізінде Til-GEC деректерімен fine-tune жасалған.
Құрылымы мен нәтижелері
| Сипаттама | Мәні |
|---|---|
| Архитектура | DeepseekV3ForCausalLM, MLA |
| Қабат саны | 24 |
| Контекст | 4096 токен |
| Формат | <қате мәтін> => <түзетілген мәтін> |
| Тест | Exact match | chrF | Keep correct |
|---|---|---|---|
| test100 | 78.0 | 93.9 | 100.0 |
| test100_v2 | 70.0 | 90.7 | 91.7 |
| test100_v3 | 71.0 | 94.4 | 83.3 |
| Орташа | 73.0 |
Іске қосу
from transformers import AutoModelForCausalLM, AutoTokenizer
repo = "TilQazyna/Til-1B-multilingual-base-GEC"
tokenizer = AutoTokenizer.from_pretrained(repo)
model = AutoModelForCausalLM.from_pretrained(repo)
inputs = tokenizer("мен кітап оқыдым керек => ", return_tensors="pt")
output = model.generate(**inputs, max_new_tokens=96, do_sample=False)
print(tokenizer.decode(output[0], skip_special_tokens=True).split(" => ", 1)[-1])
Модель сөйлем деңгейіндегі қазақша GEC үшін оқытылған; сирек және күрделі қате түрлері қосымша тексеруді қажет етеді.
Қолжетімділік
Карточка мен файлдар тізімі ашық. Жүктеу үшін «Request access» өтінімін TilQazyna командасы мақұлдайды.
Байланысты репозиторийлер
Base-модель — Til-1B-multilingual-base, оқыту деректері — Til-GEC.
Русский
Til-1B-multilingual-base-GEC — модель на 941M параметров для исправления грамматических и орфографических ошибок в казахских предложениях. Объём репозитория — 1.89 ГБ. Это fine-tune Til-1B-multilingual-base на данных Til-GEC.
Устройство и результаты
| Характеристика | Значение |
|---|---|
| Архитектура | DeepseekV3ForCausalLM, MLA |
| Слоёв | 24 |
| Контекст | 4096 токенов |
| Формат | <текст с ошибкой> => <исправленный текст> |
| Тест | Exact match | chrF | Keep correct |
|---|---|---|---|
| test100 | 78.0 | 93.9 | 100.0 |
| test100_v2 | 70.0 | 90.7 | 91.7 |
| test100_v3 | 71.0 | 94.4 | 83.3 |
| Среднее | 73.0 |
Как запустить
from transformers import AutoModelForCausalLM, AutoTokenizer
repo = "TilQazyna/Til-1B-multilingual-base-GEC"
tokenizer = AutoTokenizer.from_pretrained(repo)
model = AutoModelForCausalLM.from_pretrained(repo)
inputs = tokenizer("мен кітап оқыдым керек => ", return_tensors="pt")
output = model.generate(**inputs, max_new_tokens=96, do_sample=False)
print(tokenizer.decode(output[0], skip_special_tokens=True).split(" => ", 1)[-1])
Модель обучена для GEC на уровне отдельных казахских предложений; редкие и сложные типы ошибок требуют дополнительной проверки.
Доступ
Карточка и перечень файлов открыты. Команда TilQazyna разрешает скачивание после рассмотрения заявки через «Request access».
Связанные репозитории
Базовая модель — Til-1B-multilingual-base, данные обучения — Til-GEC.
English
Til-1B-multilingual-base-GEC is a 941M-parameter model for correcting grammatical and spelling errors in Kazakh sentences. The repository occupies 1.89 GB. It fine-tunes Til-1B-multilingual-base on Til-GEC.
Architecture and results
| Characteristic | Value |
|---|---|
| Architecture | DeepseekV3ForCausalLM, MLA |
| Layers | 24 |
| Context | 4096 tokens |
| Format | <text with errors> => <corrected text> |
| Test | Exact match | chrF | Keep correct |
|---|---|---|---|
| test100 | 78.0 | 93.9 | 100.0 |
| test100_v2 | 70.0 | 90.7 | 91.7 |
| test100_v3 | 71.0 | 94.4 | 83.3 |
| Average | 73.0 |
Usage
from transformers import AutoModelForCausalLM, AutoTokenizer
repo = "TilQazyna/Til-1B-multilingual-base-GEC"
tokenizer = AutoTokenizer.from_pretrained(repo)
model = AutoModelForCausalLM.from_pretrained(repo)
inputs = tokenizer("мен кітап оқыдым керек => ", return_tensors="pt")
output = model.generate(**inputs, max_new_tokens=96, do_sample=False)
print(tokenizer.decode(output[0], skip_special_tokens=True).split(" => ", 1)[-1])
The model targets sentence-level Kazakh GEC; rare and difficult error types still require review.
Access
The card and file list are public. The TilQazyna team grants downloads after reviewing a request submitted through “Request access.”
Related repositories
The base checkpoint is Til-1B-multilingual-base, and the training dataset is Til-GEC.
Лицензия · License: apache-2.0 · TilQazyna
- Downloads last month
- -