IA detecta deepfakes com 95% de acerto ao analisar expressões faciais

Pesquisadores desenvolvem método autossupervisionado que detecta deepfakes com mais de 95% de precisão ao analisar expressões faciais.

Novo método detecta deepfakes analisando a naturalidade das expressões faciais com 95% de acerto.
Destaques
  • O método ExposeAnyone utiliza o modelo FLAME para representar expressões faciais com 53 parâmetros.
  • O sistema precisa de apenas 60 segundos de vídeo para se adaptar a uma pessoa específica.
  • Em testes com vídeos do Sora 2, a precisão alcançou quase 95%, superando detectores anteriores.

Uma equipe internacional de pesquisadores desenvolveu um novo método para identificar vídeos manipulados por inteligência artificial (IA), os deepfakes, com uma taxa média de acerto superior a 95%. Em vez de procurar imperfeições visuais, a abordagem analisa se as expressões faciais de uma pessoa correspondem naturalmente ao que ela está dizendo, representando um salto significativo na confiabilidade da detecção. O sistema, fruto de uma colaboração entre a Universidade de Tóquio e o Instituto Max Planck de Informática, demonstrou ser capaz de identificar manipulações que passaram despercebidas por detectores já consolidados.

O desafio de detectar deepfakes cada vez mais realistas

A IA generativa já é capaz de produzir imagens e vídeos praticamente indistinguíveis de gravações reais para o olho humano. Embora essa tecnologia tenha aplicações legítimas, ela amplia os riscos de desinformação, roubo de identidade e fraudes financeiras. Por isso, desenvolver métodos confiáveis para identificar deepfakes tornou-se uma prioridade na pesquisa em IA. Os detectores mais precisos disponíveis atualmente costumam usar aprendizado supervisionado, sendo treinados com grandes conjuntos de vídeos autênticos e manipulados. Esse modelo, porém, apresenta uma limitação importante: ele pode acabar aprendendo características específicas de determinados métodos de falsificação — fenômeno conhecido como overfitting —, tornando-se menos eficiente diante de técnicas inéditas.

Já os métodos autossupervisionados utilizam apenas vídeos autênticos durante o treinamento. Embora sejam considerados mais resistentes ao surgimento de novas tecnologias de deepfake, normalmente apresentam níveis inferiores de precisão. A nova técnica, batizada de ExposeAnyone, afirma ser a primeira abordagem autossupervisionada capaz de aliar robustez com altas taxas de detecção, superando os métodos supervisionados existentes.

Como funciona a detecção de deepfakes por expressões faciais

Em vez de buscar inconsistências em pixels ou artefatos visuais, o sistema concentra sua análise nos movimentos naturais do rosto. A tecnologia utiliza o modelo FLAME, amplamente empregado em computação gráfica e animação facial, que representa matematicamente as expressões faciais por meio de 53 parâmetros. Durante o desenvolvimento, os pesquisadores realizaram um pré-treinamento utilizando mais de 450 horas de vídeos públicos. Com esse material, o modelo aprendeu a prever quais movimentos faciais seriam naturalmente esperados a partir de uma determinada trilha de áudio — ou seja, ele aprende a correlacionar fala e expressão.

Depois desse treinamento inicial, o sistema pode ser adaptado para uma pessoa específica utilizando apenas cerca de 60 segundos de vídeo, tornando-se um detector personalizado de deepfakes. Na etapa de análise, o software compara os movimentos faciais observados no vídeo suspeito com aqueles previstos a partir da fala. Quando existem diferenças significativas entre os dois conjuntos de informações, isso é interpretado como um forte indicativo de manipulação. “A combinação de aprendizado autossupervisionado e análise facial baseada no FLAME torna nossa abordagem particularmente robusta contra novos métodos de geração de deepfake, bem como contra distorções como compressão de imagem ou ruído”, afirmou Vladislav Golyanik, pesquisador sênior do Instituto Max Planck de Informática.

Precisão superior a 95% em testes com vídeos do Sora 2

Nos experimentos realizados pela equipe, o método alcançou uma precisão média superior a 95% em diversos conjuntos de dados de referência utilizados pela comunidade científica, superando o desempenho das técnicas consideradas estado da arte. Um dos desafios mais difíceis foi a avaliação em um conjunto de dados criado pelos próprios pesquisadores com vídeos gerados pelo Sora 2, modelo de geração de vídeos da OpenAI. Enquanto detectores anteriores obtiveram resultados próximos ao acaso — equivalentes a um simples lançamento de moeda —, o novo sistema conseguiu identificar corretamente quase 95% dos vídeos manipulados.

Limitações atuais e perspectivas futuras

Apesar dos resultados expressivos, os pesquisadores reconhecem que a tecnologia ainda possui limitações. O método exige um longo processo de pré-treinamento executado em hardware de alto desempenho e, no estágio atual, ainda não pode ser utilizado em aplicações em tempo real. Mesmo assim, a equipe considera que a abordagem representa um caminho promissor para o desenvolvimento da próxima geração de sistemas capazes de detectar deepfakes com maior confiabilidade, inclusive diante de técnicas de manipulação cada vez mais sofisticadas. O trabalho foi apresentado no artigo “ExposeAnyone: Personalized Audio-to-Expression Diffusion Models Are Robust Zero-Shot Face Forgery Detectors”, divulgado durante a edição de 2026 da Conferência IEEE/CVF sobre Visão Computacional e Reconhecimento de Padrões (CVPR).

Compartilhar este artigo
Canal oficial de conteúdo do portal Overcentral. A Equipe Central produz notícias, guias e análises com foco em credibilidade e relevância, garantindo que você receba o melhor conteúdo editorial diariamente.