Sentence Similarity
sentence-transformers
ONNX
Safetensors
nomic_bert
feature-extraction
dense
Generated from Trainer
dataset_size:6294
loss:MultipleNegativesRankingLoss
custom_code
Eval Results (legacy)
text-embeddings-inference
Instructions to use asmud/nomic-embed-indonesian with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- sentence-transformers
How to use asmud/nomic-embed-indonesian with sentence-transformers:
from sentence_transformers import SentenceTransformer model = SentenceTransformer("asmud/nomic-embed-indonesian", trust_remote_code=True) sentences = [ "search_query: ['Ketua', 'Umum', 'organisasi', 'apakah', 'Syamsurizal', '?']", "search_document: ['Ketua', 'Umum', 'Pengurus', 'Besar', 'Persatuan', 'Sepak', 'Takraw', 'Seluruh', 'Indonesia', '(', 'PB', 'Persetasi', ')', 'Syamsurizal', 'mengatakan', ',', 'kejurnas', 'kali', 'ini', 'tak', 'hanya', 'dimanfaatkan', 'sebagai', 'sarana', 'mencari', 'bibit', 'baru', '.', '\"', 'Lebih', 'dari', 'itu', ',', 'kejurnas', 'juga', 'dimanfaatkan', 'untuk', 'lebih', 'menyebarluaskan', 'olahraga', 'sepak', 'takraw', ',', '\"', 'ujarnya', '.']", "clustering: Dalam sebuah doa, kucoba merayu Tuhan. Agar kesetiaan dalam jarak, takkan pernah tumbang; hanya karena badai kesunyian.", "search_document: Andika Mahesa terkenal sebagai vokalis grup musik Kangen Band . Selain itu , Andika tampak dekat dengan sejumlah perempuan . Hal tersebut membuatnya mendapat julukan ' Babang Tamvan ' . Mulanya , Andika menganggap sebutan tersebut sebagai musibah . Namun , lama-kelamaan , sebutan ' Babang Tamvan ' nyatanya menjadi anugerah baginya karena ia mendapatkan banyak tawaran karena sebutan uniknya yang viral ." ] embeddings = model.encode(sentences) similarities = model.similarity(embeddings, embeddings) print(similarities.shape) # [4, 4] - Notebooks
- Google Colab
- Kaggle
| { | |
| "model_name": "nomic-embed-text-v1.5-indonesian", | |
| "base_model": "nomic-ai/nomic-embed-text-v1.5", | |
| "language": "Indonesian (Bahasa Indonesia)", | |
| "training_date": "2025-07-31T17:08:52.050708", | |
| "training_examples_count": 6294, | |
| "config": { | |
| "batch_size": 1, | |
| "epochs": 1, | |
| "warmup_steps": 19, | |
| "learning_rate": 2e-06, | |
| "weight_decay": 0.01, | |
| "gradient_accumulation_steps": 16, | |
| "max_grad_norm": 1.0, | |
| "save_steps": 200, | |
| "eval_steps": 100, | |
| "logging_steps": 50, | |
| "dataloader_num_workers": 4, | |
| "fp16": false, | |
| "dataloader_pin_memory": false, | |
| "remove_unused_columns": true, | |
| "per_device_train_batch_size": 1, | |
| "per_device_eval_batch_size": 2 | |
| }, | |
| "supported_tasks": [ | |
| "search_query", | |
| "search_document", | |
| "classification", | |
| "clustering" | |
| ] | |
| } |