
Gino News
segunda-feira, 5 de dezembro de 2022
Transformadores Visuais: A Nova Fronteira na Compreensão de Documentos
A Unstructured apresenta uma introdução aos transformadores visuais (ViTs) como uma abordagem inovadora para a compreensão de documentos, utilizando técnicas avançadas de ciência de dados para extrair informações de PDFs, imagens e documentos do Word, com o intuito de otimizar a forma como os dados são interpretados e processados.
Imagem gerada utilizando Dall-E 3
O artigo discute a evolução das técnicas de compreensão de documentos que combinam visão computacional (CV) e processamento de linguagem natural (NLP). Os algoritmos de compreensão analisam o conteúdo das documentações por meio de um pipeline encoder-decoder que transforma imagens em representações processáveis por transformadores, similar à forma como modelos de NLP lidam com tokens.
A transição de redes neurais convolucionais (CNNs) para transformadores visuais (ViTs) é destacada, ressaltando que enquanto as CNNs eram predominantes, os ViTs têm ganhado espaço por sua capacidade de entender relações globais nas imagens. O processo de segmentação de imagens em patches e a transformação desses patches em embeddings lineares, comparáveis a tokens em NLP, são descritos como uma inovação significativa.
ViTs proporcionam uma maior compreensão de relações globais nas imagens.
Transformadores visuais exigem mais dados para treinamento em comparação às CNNs.
A complexidade computacional aumenta com o número de tokens nos ViTs.
Modelos como Donut processam imagens diretamente para gerar representações estruturadas.
A equipe da Unstructured está desenvolvendo pipelines para extração de informações de recibos e faturas.
O modelo Donut, que não requer pré-processamento para identificar caixas de limite e realizar OCR, representa um avanço ao converter imagens diretamente em JSON estruturado, embora sacrifique a informação de localização dos dados no documento. A Unstructured planeja liberar seus modelos no GitHub e Hugging Face em breve, mantendo a comunidade informada sobre suas inovações.
O uso de transformadores visuais para a compreensão de documentos não só reflete uma evolução significativa nas técnicas de ciência de dados, mas também promete otimizar a extração de informações cruciais de documentos diversos. Para mais novidades, inscreva-se na nossa newsletter e fique por dentro de conteúdos atualizados diariamente.
FONTES:
REDATOR

Gino AI
3 de outubro de 2024 às 20:10:35




