🏳️‍🌈 TybyrIA v2.1 (LEGADO)

⚠️ Este modelo é legado. Use a TybyrIA v2.2, que em teste held-out atinge recall 97,3% com precisão 86,3% (@ threshold 0,40) e corrige os falsos positivos em fala afirmativa descritos abaixo.

TybyrIA v2.1 é um modelo de detecção de discurso de ódio contra pessoas LGBTQIA+ em português brasileiro, publicado em 28/10/2025 e hoje substituído pela v2.2.

Nota: este modelo já recebeu anteriormente o nome de Radar Social LGBTQIA+, hoje o nome de uma outra aplicação que utiliza a TybyrIA para análise de conteúdo em redes sociais.

🔍 Nota metodológica (19/07/2026)

Este card foi revisado em 19/07/2026. As métricas abaixo foram medidas em conjunto de teste held-out (190 exemplos nunca usados no treino). Valores divulgados anteriormente ("98,44% de recall"; "~23% de falsos positivos") vinham de uma avaliação de 28/10/2025 feita sobre a base anotada completa — que incluía os dados de treino — e não devem ser usados como referência; na mesma avaliação original, os falsos positivos correspondiam a 38,9% dos alertas.

Notas de uso: no threshold 0,30, este modelo classifica incorretamente como ódio a maior parte das frases de elogio/afirmação LGBTQIA+ do nosso conjunto de sondagem (10/12) — problema corrigido na v2.2. Com precisão held-out de 53,7%, toda saída deste modelo exige revisão humana; não use para bloqueio/remoção automática de conteúdo.

📊 Performance (teste held-out, 190 exemplos)

Métrica @ threshold 0,30 Valor Interpretação
Recall 91,5% Detecta 65 de 71 casos de ódio do teste
Precisão 53,7% Quase metade dos alertas não é ódio real
Acurácia 67,4% Acurácia geral no teste held-out
F1-Score 67,7% Equilíbrio entre precisão e recall

🎯 Uso recomendado

⚠️ Não recomendamos a v2.1 para novos usos — prefira a v2.2. Se você já usa a v2.1:

  • Trate toda classificação como candidata a revisão humana; com precisão de 53,7%, quase metade dos alertas será falso positivo.
  • Nunca use para bloqueio/remoção automática de conteúdo.
  • Atenção especial a conteúdo afirmativo/positivo sobre pessoas LGBTQIA+: é onde a v2.1 mais erra.

🔬 Metodologia

  • Base: FpOliveira/tupi-bert-base-portuguese-cased (Tupi-BERT-Base), fine-tuned para detecção de ódio anti-LGBTQIA+
  • Dataset: 1.891 comentários do Instagram anotados manualmente pela Código Não Binário (37,2% ódio); split 80% treino / 10% validação / 10% teste
  • Loss: Focal Loss (α=0.75, γ=2.0) para o desbalanceamento
  • Épocas: 4 | Learning rate: 1e-5 | Batch size: 16 (efetivo)
  • Hardware: Apple M2 (MPS), ~32 minutos de treino
  • Publicado: 28/10/2025

💻 Como usar

pip install transformers torch
from transformers import AutoTokenizer, AutoModelForSequenceClassification
import torch

model_name = "Veronyka/tybyria-v2.1"  # legado — prefira Veronyka/tybyria-v2.2
tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForSequenceClassification.from_pretrained(model_name)

text = "Seu texto aqui"
inputs = tokenizer(text, return_tensors="pt", truncation=True, max_length=256)
with torch.no_grad():
    probs = torch.softmax(model(**inputs).logits, dim=-1)
hate_prob = probs[0][1].item()

THRESHOLD = 0.30
is_hate = hate_prob >= THRESHOLD
print(f"Probabilidade de ódio: {hate_prob:.2%} — revisão humana obrigatória em qualquer resultado")

📊 Dataset

O modelo foi treinado com dados da Base de Dados de Ódio LGBTQIA+:

  • Total anotado: 1.891 comentários (Instagram, Podcast Entre Amigues)
  • Anotação: manual, 33 categorias de análise
  • Distribuição: 37,2% ódio, 62,8% não-ódio
  • Licença do dataset: CC-BY-NC-SA-4.0 (os pesos deste repositório estão sob MIT; veja abaixo)

Tipos de ódio cobertos pela anotação

Transfobia, homofobia, lesbofobia, bifobia, intersexofobia, LGBTfobia geral, assédio e insultos, ameaças e incitação à violência, patologização e pseudociência, desumanização e animalização, misgendering e deadnaming.

⚠️ Limitações

  1. Falsos positivos altos: 38,9% dos alertas na avaliação original; precisão held-out de 53,7% @0,30. Revisão humana obrigatória.
  2. Fala afirmativa: marca 10/12 frases de elogio/afirmação LGBTQIA+ como ódio (@0,30) — corrigido na v2.2.
  3. Contexto limitado: máximo de 256 tokens; textos longos são truncados.
  4. Ironia/sarcasmo: dificuldade em detectar.
  5. Idioma: português brasileiro; desempenho pode cair em PT-PT e outros dialetos.
  6. Domínio: treinado em Instagram; desempenho pode variar em outras plataformas.
  7. Escopo: focado em LGBTQIA+fobia; não detecta bem racismo, xenofobia etc.

🚀 Spaces e demos

📚 Citação

@software{tybyria_v21,
  title={TybyrIA v2.1: Sistema de Detecção de Discurso de Ódio LGBTQIA+ (legado)},
  author={{Código Não Binário}},
  year={2025},
  url={https://huggingface.co/Veronyka/tybyria-v2.1},
  note={Base: Tupi-BERT-Base + fine-tuning com Focal Loss.
        Métricas held-out (corrigidas em 19/07/2026): recall 91,5\%, precisão 53,7\% @ threshold 0,30.
        Substituído por TybyrIA v2.2.}
}

📄 Licença

Pesos e artefatos deste repositório (modelo): MIT — veja o arquivo LICENSE na raiz.

O dataset de treino permanece sob CC-BY-NC-SA-4.0 no card do dataset. Ao redistribuir ou treinar derivados, respeite a licença dos dados e as condições de terceiros (ex.: pesos base Tupi-BERT).

🤝 Contribuições

Este modelo foi desenvolvido pela Código Não Binário como parte do projeto TybyrIA / Radar Social LGBTQIA+, uma iniciativa para combater o discurso de ódio contra pessoas LGBTQIA+ na internet brasileira.

Downloads last month
58
Safetensors
Model size
0.1B params
Tensor type
F32
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for Veronyka/tybyria-v2.1

Dataset used to train Veronyka/tybyria-v2.1