Preprint / Versión 2

Os LLMs compreendem expressões idiomáticas? Evidências para uma teoria da Competência Fraseológica Artificial Simulada

article.authors6a7f58368ce35

DOI:

https://doi.org/10.1590/SciELOPreprints.16937

Keywords:

fraseologia, competência fraseológica, modelos de linguagem em grande escala

Resumen

Introdução: Os Grandes Modelos de Linguagem (LLMs) têm demonstrado desempenho expressivo em tarefas de Processamento de Linguagem Natural, mas o processamento de unidades fraseológicas, especialmente de expressões idiomáticas (EIs), permanece teoricamente desafiador. A natureza pluriverbal, cristalizada e frequentemente não composicional dessas unidades exige não apenas o reconhecimento de padrões lexicais, mas também a mobilização de conhecimentos semânticos, pragmáticos, culturais e sociocognitivos. Nesse contexto, este estudo parte da distinção entre a competência fraseológica humana, ancorada na experiência corporal, na vivência sociocultural e na inferência pragmática, e o desempenho funcional de sistemas artificiais baseado predominantemente em regularidades estatístico-distribucionais. Objetivo: O objetivo é investigar se um LLM apresenta uma competência fraseológica operacional emergente no processamento de expressões idiomáticas do português brasileiro e verificar em que medida diferentes estratégias de prompting modificam esse desempenho. Propõe-se, para isso, o conceito de competência fraseológica artificial simulada, entendido como a capacidade funcional de reconhecer, interpretar e produzir unidades fraseológicas sem que isso implique a existência de mecanismos sociocognitivos equivalentes aos humanos. Metodologia: Foi realizado um experimento quase controlado, de abordagem mista, com o modelo Claude Haiku 4.5. O corpus experimental reuniu 140 unidades, distribuídas igualmente entre expressões idiomáticas opacas, somatismos, expressões culturalmente marcadas e expressões fabricadas como contraprovas experimentais. Cada unidade foi submetida a três condições independentes de prompting: zero-shot, few-shot contextualizado e Chain-of-Thought associado a role-playing. O desempenho foi analisado em quatro dimensões: detecção da idiomaticidade (D1), precisão semântica (D2), adequação pragmática (D3) e sensibilidade cultural (D4). Resultados: Os resultados indicam elevada precisão semântica nas expressões convencionalizadas. A dimensão cultural revelou-se a mais frágil, sobretudo na identificação de culturemas, simbolismos e motivações socioculturais. Observou-se ainda ocorrência recorrente de alucinação figurativa, caracterizada pela aceitação de expressões inexistentes como unidades fraseológicas convencionais. Em contraste, as estratégias few-shot e, sobretudo, Chain-of-Thought produziram melhorias qualitativas, com a condição CoT atingindo alto grau de rejeição correta das expressões fabricadas. Conclusão: Os resultados sustentam a hipótese de que o modelo apresenta uma competência fraseológica operacional emergente, mas não uma competência fraseológica sociocognitiva equivalente à humana. O sistema consegue simular determinados resultados associados à competência fraseológica por meio de padrões estatísticos, mas permanece vulnerável a falhas de convencionalização, inferência pragmática e ancoragem cultural. Ao mesmo tempo, os resultados demonstram que a engenharia de prompt pode funcionar como mecanismo compensatório parcial, sobretudo quando incorpora exemplos, contextualização, validação empírica e critérios explícitos de rejeição.

Downloads

Los datos de descarga aún no están disponibles.

Biografía del autor/a

Thyago Jose da Cruz, Universidade Federal de Mato Grosso do Sul

Tem experiência na área de Letras e Educação do Campo, com ênfase em Língua Portuguesa e Espanhola , atuando principalmente nos seguintes temas: Língua Portuguesa e sua Prática de Ensino, Língua Espanhola e sua Prática de Ensino e Educação do Campo. É doutor em Letras, mestre em Estudos de Linguagens e desenvolve pesquisas no âmbito da Fraseologia, Fraseografia, da Semântica e da Linguística Aplicada ao Ensino. Atualmente, exerce a função de professor, lotado na Faculdade de Educação (FAED) da Universidade Federal de Mato Grosso do Sul (UFMS), nos cursos de Licenciatura em Educação do Campo ([área de Linguagens e Códigos) e de Letras (PRILEI). Além disso, é Professor Permanente do Programa de Pós-graduação stricto sensu em Letras (Unidade Universitária de Campo Grande/UEMS)

Enviado

16/07/2026

Postado

11/08/2026 — Actualizado el 14/08/2026

Versiones

Cómo citar

Os LLMs compreendem expressões idiomáticas? Evidências para uma teoria da Competência Fraseológica Artificial Simulada. (2026). In SciELO Preprints. https://doi.org/10.1590/SciELOPreprints.16937 (Original work published 2026)

Serie

Linguística, letras y artes

Plaudit

Justificación de la versión

Foram revisados detalhadamente: os dados da pesquisa, a métrica, ampliação do resumo e inserção na fundamentação teórica.

Declaración de datos

  • Los datos de investigación están disponibles a petición, condición justificada en el manuscrito