Amazon encerra ranking de uso de IA após funcionários inflarem tokens

Amazon aboliu o leaderboard de IA após funcionários inflarem tokens com o 'tokenmaxxing' via agente MeshClaw, gerando custos extras.

Funcionários da Amazon inflaram tokens de IA no MeshClaw para melhorar posições no ranking, forçando o fim do leaderboard.
Destaques
  • Amazon encerrou ranking interno de IA após funcionários inflarem tokens com o 'tokenmaxxing'.
  • Funcionários usavam o agente MeshClaw para gerar atividade artificial e melhorar posições.
  • Meta e Microsoft também enfrentam distorções similares em métricas de adoção de IA.

A Amazon encerrou o ranking interno que monitorava o uso de ferramentas de inteligência artificial após descobrir que funcionários estavam inflando artificialmente o consumo de tokens para melhorar suas posições no leaderboard. A prática, batizada internamente de “tokenmaxxing”, consistia em rodar tarefas desnecessárias — como deploys de código, envio de e-mails e operações no Slack — por meio do agente interno MeshClaw, com o único objetivo de aumentar a contagem de tokens processados. Dave Treadwell, vice-presidente sênior da unidade de e-commerce da Amazon, comunicou aos funcionários que “não usem IA apenas pelo fato de usar IA”, reconhecendo que a empresa arcou com custos adicionais significativos por causa da manipulação dos dados.

O que é o tokenmaxxing e como ele surgiu na Amazon

Em 2026, a Amazon estabeleceu como meta que mais de 80% dos desenvolvedores utilizassem ferramentas de IA semanalmente. Para acompanhar o progresso, a empresa criou um leaderboard que exibia o volume de tokens consumidos por cada equipe — inicialmente aberto a todos os funcionários. Apesar de a companhia afirmar oficialmente que o consumo de tokens não era usado em avaliações de desempenho, diversos funcionários relataram que gestores monitoravam informalmente os dados. Foi nesse ambiente que surgiu o tokenmaxxing: profissionais passaram a usar o MeshClaw, um agente de IA capaz de executar ações em nome do usuário, para gerar atividade artificial. Em vez de aumentar a produtividade, o sistema passou a ser operado para inflar métricas. A Amazon primeiro restringiu a visibilidade do ranking a cada funcionário e seu supervisor direto e, por fim, aboliu o leaderboard por completo.

O fenômeno não é isolado: Meta e Microsoft enfrentam problemas similares

A mesma dinâmica de distorção de métricas apareceu em outras gigantes da tecnologia. Na Meta, funcionários criaram um ranking interno batizado de “Claudeonomics”, que ranqueava aproximadamente 85 mil empregados pelo volume de tokens consumidos em 30 dias — o total ultrapassou 60 trilhões de tokens. Nem o CEO Mark Zuckerberg nem o CTO Andrew Bosworth figuraram entre os 250 primeiros colocados. O ranking foi removido poucos dias após vir a público, mas Bosworth defendeu a premissa do leaderboard, afirmando que seus melhores engenheiros consomem tokens proporcionais ao salário e entregam de 5 a 10 vezes mais produtividade. Já na Microsoft, executivos comunicaram internamente que o uso de IA “não é mais opcional” e instruíram gerentes a incluir a adoção de IA como critério de avaliação.

AmazonMetaMicrosoft
Meta de uso de IA>80% dos desenvolvedores semanalmenteSem meta declaradaUso como critério de avaliação
Mecanismo de rastreioMeshClaw + LeaderboardRanking criado por funcionáriosInstrução via memorandos internos
Problema identificadoTokenmaxxing (inflação de tokens)60 trilhões de tokens consumidos—
RespostaFim do rankingRemoção do ranking—

* O ranking da Meta, chamado Claudeonomics, cobria cerca de 85 mil funcionários ordenados por consumo de tokens.

A Lei de Goodhart e a corrupção das métricas de IA

O economista Charles Goodhart formulou em 1975 um princípio que se aplica perfeitamente ao caso: “Quando uma métrica se torna uma meta, ela deixa de ser uma boa métrica.” O consumo de tokens era um indicador indireto de produtividade com IA. No momento em que foi parar em um leaderboard, passou a medir não mais o uso produtivo da tecnologia, mas a capacidade dos funcionários de gerar números. O tokenmaxxing é a manifestação mais clara desse fenômeno: a métrica que deveria refletir eficiência foi sequestrada por um incentivo perverso. Funcionários que temiam ser vistos como não engajados com IA encontraram uma maneira de demonstrar conformidade sem necessariamente agregar valor real ao negócio.

O custo oculto do tokenmaxxing: investimentos bilionários baseados em dados inflados

Os investimentos em infraestrutura de IA pelas big techs atingiram patamares históricos em 2026. Amazon, Alphabet, Microsoft e Meta devem investir combinados entre US$ 650 bilhões e US$ 700 bilhões (cerca de 103 trilhões a 111 trilhões de ienes) em capex no ano. Somente a Amazon projeta gastar US$ 200 bilhões (aproximadamente 31,9 trilhões de ienes). Esses números são frequentemente justificados junto a investidores com base na demanda interna crescente por capacidade computacional. Se parte significativa dessa demanda foi artificialmente inflada por tokenmaxxing, a credibilidade dos dados que sustentam os bilionários investimentos fica comprometida. O problema não se limita ao leaderboard da Amazon: qualquer empresa que use métricas de consumo de tokens para validar decisões de infraestrutura corre o risco de basear alocações bilionárias em dados viciados.

Riscos de segurança e a reação da Amazon

Além do custo financeiro, o tokenmaxxing expôs uma fragilidade de segurança. O MeshClaw, por ser um agente com permissões para executar deploys de código, enviar e-mails e manipular o Slack em nome do usuário, estava sendo acionado para realizar tarefas reais — mesmo que desnecessárias. Funcionários expressaram preocupação com a segurança default da plataforma. Em março, uma série de incidentes relacionados a ferramentas de codificação com IA levou Treadwell a convocar uma reunião de emergência e exigir que engenheiros seniores aprovassem todo código gerado por IA para engenheiros juniores. A Amazon repetiu em três meses o padrão de incentivar o uso intensivo de IA e depois correr para conter os danos colaterais.

O encerramento do leaderboard foi a decisão correta, mas não resolve o problema de fundo. Enquanto funcionários perceberem que o uso de IA — ou a aparência dele — influencia avaliações e segurança no emprego, o tokenmaxxing continuará acontecendo fora dos holofotes. Remover a métrica não remove a pressão. A pergunta que fica é: até que ponto os números de adoção de IA apresentados pelas big techs refletem ganhos reais de produtividade ou são, em parte, o resultado de comportamentos defensivos de profissionais tentando proteger seus cargos?

Leia a reportagem original no Financial Times

Leia também

Compartilhar este artigo
Canal oficial de conteúdo do portal Overcentral. A Equipe Central produz notícias, guias e análises com foco em credibilidade e relevância, garantindo que você receba o melhor conteúdo editorial diariamente.