
Gino News
sexta-feira, 1 de novembro de 2024
Lançamento do Toxic Commons: Iniciativa para Remover Conteúdo Tóxico de Dados de Treinamento
Uma nova coleção chamada Toxic Commons foi lançada em 31 de outubro de 2024, visando criar um ambiente mais seguro e inclusivo para o treinamento de modelos de linguagem ao remover conteúdo tóxico de dados, especialmente em vários idiomas e históricos.

Imagem gerada utilizando Dall-E 3
A Toxic Commons Collection é um toolkit e pipeline desenvolvido para a remoção de conteúdo prejudicial em dados de treinamento, especialmente aqueles que incluem textos multilingues e históricos. Essa coleção inclui ferramentas como o classifier Celadon, que detecta conteúdo nocivo em nove idiomas, e um conjunto de dados com 2 milhões de amostras de texto, categorizadas em cinco tipos de conteúdo tóxico.
A identificação e remoção de conteúdo prejudicial é um desafio, principalmente devido à presença de estereótipos em textos históricos e erros de reconhecimento óptico (OCR). A coleção foi criada após a identificação de que classificadores existentes não funcionam bem em dados culturais, uma vez que a linguagem aceitável evoluiu ao longo do tempo. Os textos da coleção incluem obras em várias línguas, predominantemente do século 18 e 19.
O Celadon, um modelo de classificação baseado no DeBERTa-v3-small, foi treinado com 600 mil amostras anotadas para detectar cinco tipos de conteúdo tóxico: viés racial, viés de gênero, viés religioso, viés de capacidade e violência. O modelo foi projetado para ser rápido e econômico, levando apenas cinco minutos para processar 100 mil amostras, em comparação com 3,4 horas usando outros modelos.
Redução de conteúdo tóxico em dados de treinamento.
Classificação de textos em cinco categorias de toxicidade.
Uso de ressalvas e reescritas sintéticas para manter o tamanho dos dados.
Proposta de um pipeline adaptável para outros conjuntos de dados.
Disponibilização de ferramentas e código no GitHub.
Além de remover o conteúdo extremamente tóxico, a abordagem da Toxic Commons sugere a utilização de avisos de conteúdo sintéticos ou reescritas para textos que não sejam tão nocivos. Isso visa preservar a diversidade linguística e histórica, evitando a exclusão de vozes marginalizadas. A pesquisa continuada busca fornecer evidências empíricas sobre a eficácia dessa metodologia.
- Foco em um treinamento mais ético de modelos de linguagem. - Possibilidade de estudar a evolução da linguagem ao longo do tempo. - Ferramenta para pesquisadores e profissionais de NLP. - Aumento da responsabilidade nos projetos de IA.
A iniciativa representa um passo significativo em direção à curadoria responsável de dados abertos, permitindo que a comunidade de processamento de linguagem natural (NLP) desenvolva modelos mais sábios e éticos. A Toxic Commons também abre caminho para a análise das mudanças linguísticas e a exploração de variáveis culturais em textos históricos.
A Toxic Commons é uma proposta inovadora que busca transformar o campo do NLP, promovendo uma análise responsável de dados e preservando a diversidade linguística. Para mais informações e atualizações sobre esse tema, os leitores são encorajados a assinar a nossa newsletter e ficar por dentro das novidades que chegam diariamente.
FONTES:
REDATOR

Gino AI
1 de novembro de 2024 às 08:52:10
PUBLICAÇÕES RELACIONADAS




