
Gino News
quinta-feira, 14 de novembro de 2024
Pleias Lança o Maior Conjunto de Dados Multilingue para Treinamento de Modelos de Linguagem
A Pleias anunciou hoje o lançamento do Common Corpus, o maior conjunto de dados multilingue e aberto para treinamento de modelos de linguagem, contendo mais de 2 trilhões de tokens de conteúdo licenciado, com o objetivo de democratizar o desenvolvimento de inteligência artificial e garantir alta qualidade nos dados utilizados.

Imagem gerada utilizando Dall-E 3
A Pleias, em resposta ao debate sobre a dependência de dados com direitos autorais para treinamento de modelos de linguagem, lançou o Common Corpus, que apresenta mais de 2 trilhões de tokens coletados a partir de fontes com licenciamento permissivo. Este conjunto é parte da Iniciativa AI Alliance Open Trusted Data, projetado para atender às exigências de regulamentações como o EU AI Act, assegurando que os dados utilizados na IA não apenas sejam acessíveis, mas também de alta qualidade.
Além disso, a Pleias se comprometeu a altos padrões de qualidade nos dados, utilizando tecnologias inovadoras para correção de erros de digitalização e filtragem de conteúdo tóxico. A criação de coleções, como OpenCulture e OpenScience, oferece dados específicos em áreas de interesse, garantindo que a informação utilizada para treinar os modelos de IA seja ética e relevante.
OpenCulture: 926 bilhões de tokens de livros e conteúdo de domínio público.
OpenGovernment: 388 bilhões de tokens de documentos legais e financeiros.
OpenSource: 335 bilhões de tokens de código open source.
OpenScience: 222 bilhões de tokens de conteúdo acadêmico.
OpenWeb: 132 bilhões de tokens de conteúdo da web disponível sob licenças permissivas.
O Common Corpus não apenas apresenta um passo significativo em direção à diversidade linguística, mas também aborda a necessidade de dados de alta qualidade, superando os desafios enfrentados por conjuntos de dados obtidos por scraping da web. Com isso, a Pleias visa democratizar o acesso à tecnologia de IA, garantindo que o desenvolvimento não seja restrito aos países de língua inglesa.
O lançamento do Common Corpus pela Pleias representa uma grande evolução no campo do treinamento de modelos de linguagem, com a promessa de dados mais acessíveis, éticos e de alta qualidade. Com isso, espera-se que mais desenvolvedores e pesquisadores possam utilizar esses dados para criar tecnologias avançadas e inclusivas. Para ficar por dentro das melhores novidades sobre tecnologia e dados abertos, assine nossa newsletter e encontre mais conteúdos atualizados diariamente.
FONTES:
REDATOR

Gino AI
14 de novembro de 2024 às 15:02:14
PUBLICAÇÕES RELACIONADAS




