🏳️🌈 TybyrIA v2.1 (LEGADO)
⚠️ Este modelo é legado. Use a TybyrIA v2.2, que em teste held-out atinge recall 97,3% com precisão 86,3% (@ threshold 0,40) e corrige os falsos positivos em fala afirmativa descritos abaixo.
TybyrIA v2.1 é um modelo de detecção de discurso de ódio contra pessoas LGBTQIA+ em português brasileiro, publicado em 28/10/2025 e hoje substituído pela v2.2.
Nota: este modelo já recebeu anteriormente o nome de Radar Social LGBTQIA+, hoje o nome de uma outra aplicação que utiliza a TybyrIA para análise de conteúdo em redes sociais.
🔍 Nota metodológica (19/07/2026)
Este card foi revisado em 19/07/2026. As métricas abaixo foram medidas em conjunto de teste held-out (190 exemplos nunca usados no treino). Valores divulgados anteriormente ("98,44% de recall"; "~23% de falsos positivos") vinham de uma avaliação de 28/10/2025 feita sobre a base anotada completa — que incluía os dados de treino — e não devem ser usados como referência; na mesma avaliação original, os falsos positivos correspondiam a 38,9% dos alertas.
Notas de uso: no threshold 0,30, este modelo classifica incorretamente como ódio a maior parte das frases de elogio/afirmação LGBTQIA+ do nosso conjunto de sondagem (10/12) — problema corrigido na v2.2. Com precisão held-out de 53,7%, toda saída deste modelo exige revisão humana; não use para bloqueio/remoção automática de conteúdo.
📊 Performance (teste held-out, 190 exemplos)
| Métrica @ threshold 0,30 | Valor | Interpretação |
|---|---|---|
| Recall | 91,5% | Detecta 65 de 71 casos de ódio do teste |
| Precisão | 53,7% | Quase metade dos alertas não é ódio real |
| Acurácia | 67,4% | Acurácia geral no teste held-out |
| F1-Score | 67,7% | Equilíbrio entre precisão e recall |
🎯 Uso recomendado
⚠️ Não recomendamos a v2.1 para novos usos — prefira a v2.2. Se você já usa a v2.1:
- Trate toda classificação como candidata a revisão humana; com precisão de 53,7%, quase metade dos alertas será falso positivo.
- Nunca use para bloqueio/remoção automática de conteúdo.
- Atenção especial a conteúdo afirmativo/positivo sobre pessoas LGBTQIA+: é onde a v2.1 mais erra.
🔬 Metodologia
- Base:
FpOliveira/tupi-bert-base-portuguese-cased(Tupi-BERT-Base), fine-tuned para detecção de ódio anti-LGBTQIA+ - Dataset: 1.891 comentários do Instagram anotados manualmente pela Código Não Binário (37,2% ódio); split 80% treino / 10% validação / 10% teste
- Loss: Focal Loss (α=0.75, γ=2.0) para o desbalanceamento
- Épocas: 4 | Learning rate: 1e-5 | Batch size: 16 (efetivo)
- Hardware: Apple M2 (MPS), ~32 minutos de treino
- Publicado: 28/10/2025
💻 Como usar
pip install transformers torch
from transformers import AutoTokenizer, AutoModelForSequenceClassification
import torch
model_name = "Veronyka/tybyria-v2.1" # legado — prefira Veronyka/tybyria-v2.2
tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForSequenceClassification.from_pretrained(model_name)
text = "Seu texto aqui"
inputs = tokenizer(text, return_tensors="pt", truncation=True, max_length=256)
with torch.no_grad():
probs = torch.softmax(model(**inputs).logits, dim=-1)
hate_prob = probs[0][1].item()
THRESHOLD = 0.30
is_hate = hate_prob >= THRESHOLD
print(f"Probabilidade de ódio: {hate_prob:.2%} — revisão humana obrigatória em qualquer resultado")
📊 Dataset
O modelo foi treinado com dados da Base de Dados de Ódio LGBTQIA+:
- Total anotado: 1.891 comentários (Instagram, Podcast Entre Amigues)
- Anotação: manual, 33 categorias de análise
- Distribuição: 37,2% ódio, 62,8% não-ódio
- Licença do dataset: CC-BY-NC-SA-4.0 (os pesos deste repositório estão sob MIT; veja abaixo)
Tipos de ódio cobertos pela anotação
Transfobia, homofobia, lesbofobia, bifobia, intersexofobia, LGBTfobia geral, assédio e insultos, ameaças e incitação à violência, patologização e pseudociência, desumanização e animalização, misgendering e deadnaming.
⚠️ Limitações
- Falsos positivos altos: 38,9% dos alertas na avaliação original; precisão held-out de 53,7% @0,30. Revisão humana obrigatória.
- Fala afirmativa: marca 10/12 frases de elogio/afirmação LGBTQIA+ como ódio (@0,30) — corrigido na v2.2.
- Contexto limitado: máximo de 256 tokens; textos longos são truncados.
- Ironia/sarcasmo: dificuldade em detectar.
- Idioma: português brasileiro; desempenho pode cair em PT-PT e outros dialetos.
- Domínio: treinado em Instagram; desempenho pode variar em outras plataformas.
- Escopo: focado em LGBTQIA+fobia; não detecta bem racismo, xenofobia etc.
🚀 Spaces e demos
- Interface v2.1: radar-social-lgbtqia-v2.1 (utiliza TybyrIA v2.1)
📚 Citação
@software{tybyria_v21,
title={TybyrIA v2.1: Sistema de Detecção de Discurso de Ódio LGBTQIA+ (legado)},
author={{Código Não Binário}},
year={2025},
url={https://huggingface.co/Veronyka/tybyria-v2.1},
note={Base: Tupi-BERT-Base + fine-tuning com Focal Loss.
Métricas held-out (corrigidas em 19/07/2026): recall 91,5\%, precisão 53,7\% @ threshold 0,30.
Substituído por TybyrIA v2.2.}
}
📄 Licença
Pesos e artefatos deste repositório (modelo): MIT — veja o arquivo LICENSE na raiz.
O dataset de treino permanece sob CC-BY-NC-SA-4.0 no card do dataset. Ao redistribuir ou treinar derivados, respeite a licença dos dados e as condições de terceiros (ex.: pesos base Tupi-BERT).
🤝 Contribuições
Este modelo foi desenvolvido pela Código Não Binário como parte do projeto TybyrIA / Radar Social LGBTQIA+, uma iniciativa para combater o discurso de ódio contra pessoas LGBTQIA+ na internet brasileira.
- Downloads last month
- 58
Model tree for Veronyka/tybyria-v2.1
Base model
neuralmind/bert-base-portuguese-cased