Enquanto a indústria de inteligência artificial se concentra em desenvolver modelos cada vez maiores e complexos, uma abordagem pragmática está ganhando espaço entre desenvolvedores que precisam de soluções eficientes para problemas específicos. O projeto de classificação de emails desenvolvido por Stonefull STM representa um movimento contrário à tendência atual: em vez de usar modelos de linguagem grandes (LLMs) para todas as tarefas, o sistema implementa um pipeline em camadas que só recorre a essas ferramentas quando absolutamente necessário.
O problema da dependência excessiva de LLMs
A arquitetura padrão que domina muitos projetos de IA atualmente segue um fluxo simples: entrada → LLM → resultado. Embora funcione, essa abordagem representa um exagero para tarefas como classificação de emails, onde muitos exemplos são previsíveis e seguem padrões reconhecíveis. Faturas, notificações automáticas, newsletters e confirmações de reunião geralmente apresentam características que permitem identificação sem a necessidade de processamento por modelos complexos. O excesso de dependência de LLMs não apenas aumenta custos computacionais, mas também introduz latência desnecessária em sistemas que poderiam ser mais eficientes.
Arquitetura em camadas para classificação inteligente
A solução desenvolvida implementa um pipeline de quatro camadas que progressivamente escala em complexidade. A lógica central é simples: começar com métodos baratos e rápidos, escalando para abordagens mais sofisticadas apenas quando necessário. Esta estrutura segue o princípio da economia computacional, onde cada camada filtra casos que podem ser resolvidos sem recorrer à próxima etapa mais custosa. O resultado é um sistema que mantém a precisão enquanto reduz significativamente o uso de recursos computacionais caros.
Primeira camada: cache por hash para evitar reprocessamento
A camada inicial do pipeline implementa um sistema de cache baseado em hash do conteúdo do email. Quando um email é processado pela primeira vez, um hash único de seu conteúdo é gerado e armazenado no banco de dados junto com sua classificação. Se o mesmo email aparecer novamente, o sistema simplesmente recupera a classificação anterior, evitando qualquer reprocessamento. Esta abordagem é particularmente eficaz para emails automáticos, newsletters e outras comunicações massivas que são enviadas para múltiplos destinatários com conteúdo idêntico ou similar.
Segunda camada: heurísticas baseadas em regras simples
Quando o cache não resolve, o sistema aplica regras heurísticas definidas em arquivos YAML. Estas regras analisam características simples como domínio do remetente, padrões no assunto e expressões regulares no conteúdo. Por exemplo, emails provenientes de domínios como nubank.com.br ou paypal.com podem ser automaticamente classificados como financeiros, especialmente se contiverem palavras como “fatura”, “invoice” ou “payment” no assunto. Esta camada resolve a maioria dos casos triviais com velocidade quase instantânea e custo computacional insignificante.
Terceira camada: similaridade semântica via embeddings
Para emails que não são capturados pelas heurísticas, o sistema utiliza similaridade semântica. O texto do email é convertido em um vetor numérico usando modelos sentence-transformers, que são significativamente mais leves que LLMs completos. Este vetor é então comparado com exemplos já classificados usando similaridade de cosseno. Se o email apresentar características semânticas suficientemente próximas de exemplos conhecidos, sua classificação pode ser inferida sem necessidade de processamento mais complexo.
Quarta camada: LLM como fallback para casos ambíguos
Apenas quando nenhuma das três camadas anteriores consegue classificar o email com confiança suficiente, o sistema recorre a um LLM. A implementação atual utiliza modelos locais executados via Ollama, permitindo que todo o pipeline funcione sem dependência de serviços externos. As respostas do modelo são estruturadas em JSON para facilitar o parsing e integração com o resto do sistema. Esta camada é reservada exclusivamente para os casos mais ambíguos e complexos que realmente exigem compreensão contextual profunda.
Resultados práticos da abordagem híbrida
Nos testes iniciais, a arquitetura em camadas demonstrou eficácia impressionante. A maioria dos emails é classificada antes de chegar à camada do LLM, com as heurísticas resolvendo muitos casos e os embeddings tratando boa parte do restante. Esta distribuição reduz drasticamente custos computacionais, latência de processamento e dependência de modelos grandes. Em execuções práticas, o sistema frequentemente processa dezenas de emails com apenas alguns precisando de intervenção do LLM, representando uma economia significativa de recursos.
Estrutura técnica do projeto open source
O projeto está organizado em uma estrutura modular que separa responsabilidades claramente. O diretório principal contém subdiretórios para a interface de linha de comando (CLI), o pipeline central de classificação, o parsing e leitura de emails, o modelo de embeddings, a integração com LLMs, persistência em SQLite e exemplos de emails para testes. Esta organização facilita a manutenção, extensão e compreensão do código por outros desenvolvedores interessados em adaptar a solução para seus próprios casos de uso.
Interface de linha de comando para execução prática
O sistema inclui uma interface de linha de comando que permite executar o pipeline diretamente a partir do terminal. O comando triage run processa emails e apresenta resultados formatados que indicam qual camada resolveu cada caso, a classificação atribuída e o nível de confiança. Esta interface não apenas facilita testes e demonstrações, mas também serve como base para integrações mais complexas com sistemas de email existentes.
Motivação por trás da abordagem minimalista
A motivação central do projeto vai além da simples classificação de emails. Representa uma crítica construtiva à tendência atual de focar exclusivamente em modelos cada vez maiores, muitas vezes negligenciando a arquitetura ao redor desses modelos. Em sistemas reais, a eficiência geral frequentemente depende mais da inteligência do pipeline do que do poder bruto do modelo principal. Esta abordagem reconhece que LLMs são ferramentas poderosas, mas que devem ser usadas estrategicamente, não como solução universal para todos os problemas.
Disponibilidade como projeto open source
O código foi disponibilizado como open source no GitHub, permitindo que outros desenvolvedores estudem, adaptem e melhorem a arquitetura. Esta decisão reflete uma filosofia de compartilhamento de conhecimento e colaboração que caracteriza parte da comunidade de IA. O repositório inclui documentação, exemplos e instruções para configuração, facilitando a adoção por interessados em pipelines de IA, classificação de texto ou arquiteturas híbridas que combinam heurísticas, aprendizado de máquina e LLMs.
Ao priorizar eficiência sobre complexidade desnecessária, esta abordagem oferece um modelo alternativo para implementações práticas de IA. Em um cenário onde custos computacionais e latência são preocupações reais, soluções que maximizam o retorno sobre investimento em recursos de processamento se tornam cada vez mais valiosas. A arquitetura apresentada não apenas resolve o problema específico de classificação de emails, mas também serve como estudo de caso para uma filosofia de design mais ampla: usar a ferramenta certa para cada tarefa, em vez da ferramenta mais poderosa para todas as tarefas.

