
Gino News
segunda-feira, 6 de janeiro de 2025
Comparativo de Modelos de Linguagem: DeepSeek-V3 e Outros em Novos Testes de Benchmark
Em um estudo recente, Wolfram Ravenwolf atualizou suas comparações de modelos de linguagem, avaliando novos modelos como DeepSeek-V3, QVQ-72B-Preview e Falcon3 10B em um benchmark específico, o MMLU-Pro CS, revelando tanto surpresas quanto desempenhos consistentes de tecnologias emergentes.

Imagem gerada utilizando Dall-E 3
Wolfram Ravenwolf divulgou um novo relatório em 2 de janeiro de 2025, onde testou diversos modelos de linguagem, incluindo algumas versões novas como DeepSeek-V3 e QVQ-72B-Preview, além de modelos já existentes como Llama 3.3 e Nemotron 70B. Essa atualização é uma continuação de seu trabalho anterior, onde foram analisados 25 modelos diferentes, usando o benchmark MMLU-Pro CS, que avalia a habilidade dos modelos nas áreas de ciência da computação.
A análise do DeepSeek-V3, que possui 671 bilhões de parâmetros e utiliza uma arquitetura de Mixture-of-Experts, foi notável. Embora tenha se destacado por sua velocidade e baixo custo de execução, alcançou uma precisão de apenas 78%, empatando com o Qwen2.5. Os modelos Llama 3.3 e Nemotron também mostraram desempenhos respeitáveis, mas continuam a ser ofuscados por modelos mais recentes, especialmente os chineses.
Entre as surpresas, o modelo QVQ-72B-Preview, focado em raciocínio visual, não se destacou como esperado, alcançando apenas 70%. Já o Falcon3 10B, embora menor, alcançou um desempenho de 61%, superando outros modelos maiores, destacando-se como uma opção viável para aplicações em vários idiomas.
Ravenwolf também oferece uma visão detalhada sobre o benchmark MMLU-Pro, que agora inclui 10 opções de resposta por questão, aumentando a complexidade e melhorando a precisão dos resultados. Com mais de 88 horas de testes, ele ressalta a importância desse benchmark para a evolução contínua dos modelos de linguagem, prometendo novas análises e melhorias para o futuro.
Esta atualização reforça a relevância dos benchmarks na avaliação de modelos de linguagem, mostrando que mesmo os mais novos não são invulneráveis a limitações. A pesquisa contínua e a evolução dos modelos prometem avanços significativos na área. O leitor é encorajado a acompanhar esses desenvolvimentos e explorar mais através da assinatura da nossa newsletter, que traz conteúdos atualizados diariamente.
FONTES:
REDATOR

Gino AI
6 de janeiro de 2025 às 08:46:38
PUBLICAÇÕES RELACIONADAS




