Instructions to use dim/tiny-llama-2T-open-orca-ru-10000-step with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use dim/tiny-llama-2T-open-orca-ru-10000-step with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-generation", model="dim/tiny-llama-2T-open-orca-ru-10000-step")# Load model directly from transformers import AutoTokenizer, AutoModelForCausalLM tokenizer = AutoTokenizer.from_pretrained("dim/tiny-llama-2T-open-orca-ru-10000-step") model = AutoModelForCausalLM.from_pretrained("dim/tiny-llama-2T-open-orca-ru-10000-step", device_map="auto") - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use dim/tiny-llama-2T-open-orca-ru-10000-step with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "dim/tiny-llama-2T-open-orca-ru-10000-step" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "dim/tiny-llama-2T-open-orca-ru-10000-step", "prompt": "Once upon a time,", "max_tokens": 512, "temperature": 0.5 }'Use Docker
docker model run hf.co/dim/tiny-llama-2T-open-orca-ru-10000-step
- SGLang
How to use dim/tiny-llama-2T-open-orca-ru-10000-step with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "dim/tiny-llama-2T-open-orca-ru-10000-step" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "dim/tiny-llama-2T-open-orca-ru-10000-step", "prompt": "Once upon a time,", "max_tokens": 512, "temperature": 0.5 }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "dim/tiny-llama-2T-open-orca-ru-10000-step" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "dim/tiny-llama-2T-open-orca-ru-10000-step", "prompt": "Once upon a time,", "max_tokens": 512, "temperature": 0.5 }' - Docker Model Runner
How to use dim/tiny-llama-2T-open-orca-ru-10000-step with Docker Model Runner:
docker model run hf.co/dim/tiny-llama-2T-open-orca-ru-10000-step
Вопрос про обучение модели
Эта модель уже неплохо говорит на русском (хоть и с акцентом переводчика Google).
Но изначально tiny llama этого не умеет вроде бы вообще.
Как у вас это получилось? Где-то я читал, что если в наборах данных модели, на которых она изначально создавалась, чего-то нет, то и дообучать её этому практически бесполезно.
Мне бы хотелось попробовать повторить этот опыт с другими небольшими моделями, например вот эта довольно смышлёная:
https://huggingface.co/acrastt/Marx-3B-V3
Какое оборудование и программы для этого нужны?
Добрый день. Я дообучил данную модель при помощи framework'a axolotl. В данном репозитории есть много конфигов под различные foundational модели, советую изучить их подробно и подобрать наиболее подходящий для вас формат датасетов.
Конфиг для обучения данной модели можно найти тут. Также в данном репозитории вы можете найти docker container с cuda, чтобы с минимальными усилиями воспроизвести походую среду разработки.
Оборудование которое я использовал это 2-A100-40GB. Но я уверен что если использовать adamw_bnb_8bit, batch_size=1, gradient_accumulation_steps >= 64 вы сможете добиться схожих результатах и на видеокарте с 12GB, в идеале конечно найти RTX 3090.
Если же своего оборудования нет, вы можете попробовать kaggle или google colab, но тогда придется держать открытой вкладку браузера долгое время.
По своему опыту скажу что практически бесполезно тюнить модели(даже полный файнтюн), которые обучались на SlimPajama.
График обучения можно найти и в репозитории. ссылка на wandb