Preprint / Versão 2

Os LLMs compreendem expressões idiomáticas? Evidências para uma teoria da Competência Fraseológica Artificial Simulada

article.authors6a814800504df

DOI:

https://doi.org/10.1590/SciELOPreprints.16937

Palavras-chave:

fraseologia, competência fraseológica, modelos de linguagem em grande escala

Resumo

Introdução: Os Grandes Modelos de Linguagem (LLMs) têm demonstrado desempenho expressivo em tarefas de Processamento de Linguagem Natural, mas o processamento de unidades fraseológicas, especialmente de expressões idiomáticas (EIs), permanece teoricamente desafiador. A natureza pluriverbal, cristalizada e frequentemente não composicional dessas unidades exige não apenas o reconhecimento de padrões lexicais, mas também a mobilização de conhecimentos semânticos, pragmáticos, culturais e sociocognitivos. Nesse contexto, este estudo parte da distinção entre a competência fraseológica humana, ancorada na experiência corporal, na vivência sociocultural e na inferência pragmática, e o desempenho funcional de sistemas artificiais baseado predominantemente em regularidades estatístico-distribucionais. Objetivo: O objetivo é investigar se um LLM apresenta uma competência fraseológica operacional emergente no processamento de expressões idiomáticas do português brasileiro e verificar em que medida diferentes estratégias de prompting modificam esse desempenho. Propõe-se, para isso, o conceito de competência fraseológica artificial simulada, entendido como a capacidade funcional de reconhecer, interpretar e produzir unidades fraseológicas sem que isso implique a existência de mecanismos sociocognitivos equivalentes aos humanos. Metodologia: Foi realizado um experimento quase controlado, de abordagem mista, com o modelo Claude Haiku 4.5. O corpus experimental reuniu 140 unidades, distribuídas igualmente entre expressões idiomáticas opacas, somatismos, expressões culturalmente marcadas e expressões fabricadas como contraprovas experimentais. Cada unidade foi submetida a três condições independentes de prompting: zero-shot, few-shot contextualizado e Chain-of-Thought associado a role-playing. O desempenho foi analisado em quatro dimensões: detecção da idiomaticidade (D1), precisão semântica (D2), adequação pragmática (D3) e sensibilidade cultural (D4). Resultados: Os resultados indicam elevada precisão semântica nas expressões convencionalizadas. A dimensão cultural revelou-se a mais frágil, sobretudo na identificação de culturemas, simbolismos e motivações socioculturais. Observou-se ainda ocorrência recorrente de alucinação figurativa, caracterizada pela aceitação de expressões inexistentes como unidades fraseológicas convencionais. Em contraste, as estratégias few-shot e, sobretudo, Chain-of-Thought produziram melhorias qualitativas, com a condição CoT atingindo alto grau de rejeição correta das expressões fabricadas. Conclusão: Os resultados sustentam a hipótese de que o modelo apresenta uma competência fraseológica operacional emergente, mas não uma competência fraseológica sociocognitiva equivalente à humana. O sistema consegue simular determinados resultados associados à competência fraseológica por meio de padrões estatísticos, mas permanece vulnerável a falhas de convencionalização, inferência pragmática e ancoragem cultural. Ao mesmo tempo, os resultados demonstram que a engenharia de prompt pode funcionar como mecanismo compensatório parcial, sobretudo quando incorpora exemplos, contextualização, validação empírica e critérios explícitos de rejeição.

Downloads

Os dados de download ainda não estão disponíveis.

Biografia do Autor

Thyago Jose da Cruz, Universidade Federal de Mato Grosso do Sul

Tem experiência na área de Letras e Educação do Campo, com ênfase em Língua Portuguesa e Espanhola , atuando principalmente nos seguintes temas: Língua Portuguesa e sua Prática de Ensino, Língua Espanhola e sua Prática de Ensino e Educação do Campo. É doutor em Letras, mestre em Estudos de Linguagens e desenvolve pesquisas no âmbito da Fraseologia, Fraseografia, da Semântica e da Linguística Aplicada ao Ensino. Atualmente, exerce a função de professor, lotado na Faculdade de Educação (FAED) da Universidade Federal de Mato Grosso do Sul (UFMS), nos cursos de Licenciatura em Educação do Campo ([área de Linguagens e Códigos) e de Letras (PRILEI). Além disso, é Professor Permanente do Programa de Pós-graduação stricto sensu em Letras (Unidade Universitária de Campo Grande/UEMS)

Enviado

16/07/2026

Postado

11/08/2026 — Atualizado em 14/08/2026

Versões

Como Citar

Os LLMs compreendem expressões idiomáticas? Evidências para uma teoria da Competência Fraseológica Artificial Simulada. (2026). Em SciELO Preprints. https://doi.org/10.1590/SciELOPreprints.16937 (Original work published 2026)

Série

Linguística, letras e artes

Plaudit

Justificativa da versão

Foram revisados detalhadamente: os dados da pesquisa, a métrica, ampliação do resumo e inserção na fundamentação teórica.

Declaração de dados

  • Os dados de pesquisa estão disponíveis sob demanda, condição justificada no manuscrito