Um preprint anunciado no arXiv às 00:00 UTC de 19 de agosto mede onde os caminhos de relay de API de LLM quebram o isolamento do cache de prompts. A constatação é uniforme: todos os cinco gateways open source testados, conectados tanto à OpenAI quanto à Anthropic, falharam em vincular clientes às credenciais upstream por padrão, e todos os cinco expuseram leituras de cache entre clientes em ambos os provedores.

O que é o ataque

O cache de prompts torna prefixos repetidos mais baratos ao armazená-los upstream. Quando um gateway agrega vários clientes sob uma única credencial, o cache é compartilhado, e diferenças de tempo revelam se o prefixo de outro cliente já está presente. Em medições de produção que cobriram 80,5% do volume de tokens elegível na OpenRouter, os autores identificaram leituras entre contas para 12 de 28 rótulos, representando 33,7% do volume. Em uma rota de produção, eles recuperaram oito posições-alvo consecutivas sem qualquer acesso ao alvo.

O que a narrativa comum erra

Esta é uma medição de uma lacuna de isolamento, não uma violação. Nenhum dado de cliente foi roubado, nenhum incidente ocorreu, e nada aqui é evidência de exploração no mundo real. Os pesquisadores criaram as condições e mediram o que vazou. Relatar isso como "gateways de LLM hackeados" ou "prompts roubados" descreve um evento que não aconteceu.

Também se trata de um preprint: anunciado no arXiv, sem revisão por pares, e não replicado de forma independente. Em segundo lugar, a falha é um padrão de configuração, não uma lei da natureza — os gateways podem ser configurados de outra forma, e o ponto do artigo é que eles não o são, fora da caixa.

O número que complica a defesa

A defesa proposta — inserir divisões de identidade do cache após prefixos públicos reutilizáveis — custa 1,7% a 2,5%. Um defeito cuja correção consome menos de dois anos e meio por cento do gasto é difícil de defender como uma troca de desempenho consciente, o que torna o padrão indefensável em vez de apenas infeliz.

Por que os relays importam

Gateways ficam entre aplicações e provedores de modelos para lidar com roteamento, failover, controle de gastos e abstração multi-provedor. Todo o seu valor está no pooling — e reunir credenciais é exatamente o que colapsa a fronteira entre locatários. Qualquer equipe que opere um relay compartilhado na frente de uma API de modelo paga deve conseguir dizer em qual credencial a solicitação de um determinado cliente trafega.