top of page

Gino News

segunda-feira, 5 de dezembro de 2022

Transformadores Visuais: A Nova Fronteira na Compreensão de Documentos

Tecnologia Inteligência Artificial Ciência de Dados

A Unstructured apresenta uma introdução aos transformadores visuais (ViTs) como uma abordagem inovadora para a compreensão de documentos, utilizando técnicas avançadas de ciência de dados para extrair informações de PDFs, imagens e documentos do Word, com o intuito de otimizar a forma como os dados são interpretados e processados.

Imagem gerada utilizando Dall-E 3

O artigo discute a evolução das técnicas de compreensão de documentos que combinam visão computacional (CV) e processamento de linguagem natural (NLP). Os algoritmos de compreensão analisam o conteúdo das documentações por meio de um pipeline encoder-decoder que transforma imagens em representações processáveis por transformadores, similar à forma como modelos de NLP lidam com tokens.


A transição de redes neurais convolucionais (CNNs) para transformadores visuais (ViTs) é destacada, ressaltando que enquanto as CNNs eram predominantes, os ViTs têm ganhado espaço por sua capacidade de entender relações globais nas imagens. O processo de segmentação de imagens em patches e a transformação desses patches em embeddings lineares, comparáveis a tokens em NLP, são descritos como uma inovação significativa.


  1. ViTs proporcionam uma maior compreensão de relações globais nas imagens.

  2. Transformadores visuais exigem mais dados para treinamento em comparação às CNNs.

  3. A complexidade computacional aumenta com o número de tokens nos ViTs.

  4. Modelos como Donut processam imagens diretamente para gerar representações estruturadas.

  5. A equipe da Unstructured está desenvolvendo pipelines para extração de informações de recibos e faturas.


O modelo Donut, que não requer pré-processamento para identificar caixas de limite e realizar OCR, representa um avanço ao converter imagens diretamente em JSON estruturado, embora sacrifique a informação de localização dos dados no documento. A Unstructured planeja liberar seus modelos no GitHub e Hugging Face em breve, mantendo a comunidade informada sobre suas inovações.


O uso de transformadores visuais para a compreensão de documentos não só reflete uma evolução significativa nas técnicas de ciência de dados, mas também promete otimizar a extração de informações cruciais de documentos diversos. Para mais novidades, inscreva-se na nossa newsletter e fique por dentro de conteúdos atualizados diariamente.


FONTES:

    1. HuggingFace

    2. Donut Model

    3. Unstructured Team

    4. LinkedIn Unstructured

    5. Medium Unstructured

    REDATOR

    Gino AI

    3 de outubro de 2024 às 20:10:35

    PUBLICAÇÕES RELACIONADAS

    Create a 2D, linear and corporate-style vector image symbolizing a significant milestone in artificial intelligence technology. This image shows the Gemini 2.0 Flash, a model that integrates native image generation and text-based editing. The interface of Gemini 2.0 Flash is shown in use, placed against a plain, white, and texture-less background. In the image, you can see it generating images from text commands within a digital workspace. Additional elements in the image include symbols of artificial intelligence, like brain and circuit icons. Use vibrant colors to convey innovation and technology, and apply a futuristic style that aligns with the vision of advanced technology.

    Google Lança Gemini 2.0 Flash: Revolução na Geração de Imagens com IA

    Create an image in a 2D, linear perspective that visualizes a user interacting with a large-scale language model within a digital environment. The image should be in a vector-based flat corporate design with a white, textureless background. Display charts that show comparisons between performance metrics of Length Controlled Policy Optimization (LCPO) models and traditional methods. Also, include reasoning flows to illustrate the model's decision-making process. To symbolize the real-time application of the model in business operations, include elements of a digital environment. Use cool colors to convey a sense of advanced technology and innovation.

    Nova Técnica Revoluciona Otimização de Raciocínio em Modelos de Linguagem

    Illustrate a 2D, linear perspective image in a corporate, flat and vector style. The image has a textureless, white background. In the foreground, focus on a central figure who symbolizes a leadership role in AI, but not specifically Stephen Peacock. He is explaining the application of AI in game development. Include a visual context of the game development environment and a logo symbolizing an international game development provider, but not specifically the Keywords Studios logo.

    Keywords Studios Lança Soluções de IA para Desenvolvimento de Jogos

    Create a flat, corporate-style, vector image. The setting is Mar 9, 2025, and it captures the concept of AI agents integrating with the business environment, symbolizing the transition from an app-based world to a more dynamic and fluid environment. The background of the image is textureless and white. The perspective is 2D and linear. Additional elements include sober colors like blue and gray to convey a sense of technology and modernity, silhouettes of robots and humans interacting to represent collaboration between AI and users, and floating graphics and data symbolizing the fluidity of real-time information.

    A Revolução do Software: Como a IA Está Transformando o Mercado

    Fique por dentro das últimas novidades em IA

    Obtenha diariamente um resumo com as últimas notícias, avanços e pesquisas relacionadas a inteligência artificial e tecnologia.

    Obrigado pelo envio!

    logo genai

    GenAi Br © 2024

    • LinkedIn
    bottom of page