As expressões idiomáticas expõem uma lacuna entre o reconhecimento de palavras e a compreensão da linguagem. Seus significados são frequentemente não composicionais: conhecer cada palavra individual não basta para recuperar o que a expressão significa no contexto. Um sistema pode analisar perfeitamente “break a leg” e ainda assim confundir incentivo com lesão.
01Quando a linguagem deixa de ser literal
Os humanos distinguem rotineiramente leituras literais e figurativas a partir do contexto. “She spilled the tea on the table” descreve um acidente; “she spilled the tea about the meeting” descreve uma revelação. Essa distinção continua difícil para sistemas de linguagem natural porque a sobreposição lexical pode ser quase idêntica enquanto o significado muda completamente.
O projeto original partiu de uma limitação prática: muitos recursos idiomáticos são modestos em escala, limitados na cobertura linguística ou concebidos em torno de uma tarefa isolada. Em vez disso, o IdiomX trata a compreensão idiomática como uma sequência de problemas relacionados — do reconhecimento do uso figurativo à recuperação e explicação do significado entre idiomas.

02Construindo um conjunto de dados multilíngue em escala
O lançamento público contém mais de 190.000 exemplos contextuais abrangendo mais de 12.000 expressões idiomáticas. As expressões inglesas estão ligadas às representações semânticas árabes e francesas, juntamente com rótulos de uso idiomáticos, literais e limítrofes e metadados linguísticos de apoio.
O processo de construção combina recursos lexicais, geração controlada e validação. Sua estrutura modular é tão importante quanto seu tamanho: o objetivo é tornar cada etapa inspecionável e repetível, em vez de publicar um arquivo final opaco.
Coleta
Extraia expressões idiomáticas candidatas de fontes que incluem dados derivados do Wiktionary e do WordNet, ampliando a cobertura com candidatas modernas e geradas.
Limpeza e normalização
Filtre ruídos, padronize expressões, remova duplicatas e prepare registros consistentes para enriquecimento e avaliação.
Enriquecimento LLM controlado
Use GPT-4.1-mini para gerar significados, exemplos contextuais e campos semânticos alinhados em inglês, árabe e francês.
Validação estruturada
Combine pontuação de similaridade semântica, verificações baseadas em regras, desduplicação e divisões com reconhecimento de vazamento para oferecer suporte a benchmarking confiável.

03Mais do que um conjunto de dados: um benchmark progressivo
IdiomX é organizado como uma progressão. A primeira tarefa pergunta se um modelo reconhece o uso figurativo. As tarefas posteriores perguntam se é possível recuperar uma expressão idiomática apropriada do contexto, alinhar o significado entre os idiomas e retornar uma explicação que uma pessoa possa inspecionar.

04Quatro tarefas, do reconhecimento à interpretação
Detecção de expressões idiomáticas
Determine se uma expressão está sendo usada idiomaticamente ou literalmente em sua frase.
- Comparado
- TF-IDF com regressão logística, DistilBERT e RoBERTa
- Melhor relatado
- RoBERTa
- Capacidade
- Desambiguação contextual
Recuperação de contexto para expressão idiomática
Dada uma frase contextual, classifique as expressões idiomáticas que melhor expressam seu significado figurativo subjacente.
- Comparado
- Recuperação densa, lexical e híbrida com reclassificação
- Melhor relatado
- Recuperação híbrida com um reclassificador ajustado
- Capacidade
- Recuperação semântica
Recuperação de árabe para o inglês
Use um contexto árabe para recuperar a expressão idiomática correspondente em inglês, testando o alinhamento semântico entre os idiomas.
- Comparado
- MiniLM multilíngue, E5 multilíngue e E5 ajustado
- Melhor relatado
- E5 ajustado
- Capacidade
- Alinhamento translingual
Interpretação de expressões idiomáticas
Recupere a expressão idiomática canônica e explique seu significado em inglês, árabe e francês.
- Comparado
- Recuperação densa e híbrida, com e sem reclassificação
- Melhor relatado
- Recuperação híbrida com reclassificação
- Capacidade
- Fundamentação semântica explicável
05O que os experimentos de benchmark encontraram
O projeto relata que os transformadores contextuais melhoram substancialmente a detecção de expressões idiomáticas, enquanto a recuperação híbrida léxico-densa supera a recuperação densa sozinha. O ajuste fino é particularmente importante para a tarefa de árabe para o inglês, onde as formas superficiais fornecem pouca ajuda lexical direta.
| Tarefa | Configuração principal relatada | Resultado principal |
|---|---|---|
| Detecção | RoBERTa | 92,6% de precisão · F1 0,926 |
| Contexto → expressão idiomática | Recuperação híbrida + reclassificador ajustado | Top-1 88,5% |
| Árabe → expressão idiomática em inglês | E5 ajustado | Top-1 57,8% |
| Interpretação | Recuperação híbrida + reclassificador | Top-1 67,4% |
Os números não são intercambiáveis: cada tarefa testa um espaço de busca e uma dificuldade diferentes. Seu valor combinado é a progressão da classificação em direção à recuperação multilíngue e à saída interpretável.
Uma saída da Tarefa 4 é projetada para ser legível
06Por que a compreensão da linguagem figurada é importante
Expressões idiomáticas não são casos extremos confinados a dicionários. Elas aparecem em conversas, solicitações de suporte, redes sociais, legendas, material didático e instruções do dia a dia. Os sistemas que as interpretam literalmente podem compreender mal a intenção, mesmo quando cada token individual é familiar.
07O projeto é aberto: dados, código, artigo científico e demonstrações
IdiomX separa o pipeline de construção do conjunto de dados do repositório de modelagem e benchmark. Isto torna a proveniência do recurso mais fácil de inspecionar, ao mesmo tempo que mantém os notebooks das tarefas, os artefatos treinados e as demonstrações organizadas em torno da avaliação.
Ayman Ali Sharara
Aluno da DSTI no MSc in Data Science & AI, estudando via Online assíncrono. Seu trabalho abrange PLN multilíngue, engenharia de dados, sistemas de recuperação e aplicações práticas de IA. O IdiomX foi desenvolvido como seu projeto de Deep Learning with Python.
Artigo adaptado para o DSTI TechBlog da contribuição original do projeto estudantil de Ayman Sharara e da documentação pública atual do projeto. A redação e a apresentação foram revisadas, preservando os métodos, reivindicações e resultados relatados do projeto.