Preprint / Versão 2

O desempenho de grandes modelos de linguagem na síntese de relatos de pesquisa educacional: Estudo comparativo com artigos no idioma português

article.authors6abf7f7c9fd14

DOI:

https://doi.org/10.1590/SciELOPreprints.17611

Palavras-chave:

Inteligência Artificial Generativa, Vieses Algorítmicos, Comunicação científica

Resumo

Este estudo objetiva comparar o desempenho do ChatGPT 5.0, Gemini 3.0 Flash e DeepSeek V3 na síntese de artigos científicos publicados em português. Adotou-se abordagem mista, com teste de geração de resumos para cinco artigos da área da educação em três variações de prompt. A análise dos outputs foi realizada por 15 especialistas nas temáticas dos artigos que utilizaram uma escala ordinal de Percepção de Qualidade (PQ) para mensurar as dimensões de qualidade de conteúdo e isenção de vieses. Os resultados indicaram bom desempenho dos modelos, com resultados de PQ entre 84% e 94% do escore total. O teste de Kruskal-Wallis identificou diferenças significativas na comparação dos resultados por artigo, (H(4) = 24,040, p < 0,001) e inexistência de diferenças entre os modelos (H(2) = 1,604, p = 0,448) ou tipos de prompt (H(8) = 2,506, p = 0,961), sugerindo paridade tecnológica na tarefa de síntese de textos científicos. Ao lado disso, a análise qualitativa identificou tendência à generalização e à supressão de marcadores de incerteza, evidências que indicam falhas na validade dos resumos produzidos. Os resultados obtidos também sugerem potenciais vieses oriundos do idioma de treinamento dos modelos, que, hipoteticamente, podem afetar a captura da textura narrativa e de jargão específico da ciência produzida em português. Concluiu-se que, embora os modelos de IAG testados apresentem bom desempenho sintático, a supervisão humana permanece indispensável para garantia da fidedignidade e integralidade da comunicação científica da pesquisa em educação.

Downloads

Os dados de download ainda não estão disponíveis.

Enviado

23/08/2026

Postado

17/09/2026 — Atualizado em 28/09/2026

Versões

Como Citar

O desempenho de grandes modelos de linguagem na síntese de relatos de pesquisa educacional: Estudo comparativo com artigos no idioma português. (2026). Em SciELO Preprints. https://doi.org/10.1590/SciELOPreprints.17611 (Original work published 2026)

Série

Ciências Humanas

Plaudit

Justificativa da versão

Esta versão foi atualizada em 26/9/2026 para correção de erros na digitação das estatísticas dos testes de Kruskal-Wallis destinados à comparação de resultados por modelo de IAG e tipo de prompt. Também foi inserida, no Quadro 1, a íntegra do conteúdo dos prompts utilizados e foi ajustado o tópico dos resultados referentes à análise baseada nos tipos de prompt, pois os gráficos das figuras 2 e 3 continham imprecisões. Eles foram substituídos por uma tabela. Os ajustes não invalidam a versão anterior no que se refere às conclusões ou as discussões decorrentes da interpretação dos resultados.

Declaração de dados