A empresa de segurança Pillar Security publicou na segunda-feira, 20 de julho, o "The Week of Sandbox Escapes" — uma série de divulgações que mostra que quatro dos agentes de codificação de IA mais usados, Cursor, OpenAI Codex CLI, Google Gemini CLI e Google Antigravity, podiam ser escapados por atacantes sem que o sandbox fosse quebrado.
O truque: escrever o futuro
Os pesquisadores Eilon Cohen, Dan Lisichkin e Ariel Fogel encontraram um padrão comum: o agente em sandbox escreve um arquivo ou configuração que um componente confiável fora do sandbox depois executa, carrega ou verifica. Como a Pillar resume: "Se um agente consegue escrever as entradas futuras de sistemas, ele nunca esteve em um sandbox em primeiro lugar." Um repositório comprometido ou uma injeção indireta de prompt é suficiente para fazer o agente plantar o payload.
As falhas específicas
Destaques da série: um Docker socket exposto e acessível de dentro do sandbox atingiu Codex, Cursor e Gemini CLI ao mesmo tempo (GHSA-v4xv-rqh3-w9mc). O suporte do Cursor a .claude hook configs permitiu execução de comandos sem sandbox (CVE-2026-48124, corrigida no Cursor 3.0.0), além de uma troca de interpretador do venv do Python e um truque de git fsmonitor. No Codex CLI, o bypass "GitPwned" abusou da allowlist que confiava em git show pelo nome, embora a chamada não fosse de fato somente leitura — corrigido na v0.95.0, com a OpenAI pagando uma recompensa de alta severidade. Na Antigravity, a Pillar demonstrou um bypass de denylist do macOS Seatbelt e uma via de injeção de tarefas do VS Code.
Fornecedores divergem sobre a gravidade
Cursor e OpenAI lançaram correções e reconheceram as descobertas. O Google classificou os dois problemas da Antigravity como "outras vulnerabilidades de segurança válidas" e rebaixou sua gravidade por serem difíceis de explorar, já que exigem que um usuário abra um repositório malicioso — ou seja, essas rotas foram reconhecidas, mas não totalmente corrigidas.
Uma sequência de análises profundas
A Pillar está divulgando um texto técnico por dia nesta semana, portanto os detalhes completos da exploração ainda estão sendo publicados — e, com milhões de desenvolvedores usando esses agentes em máquinas corporativas, a orientação de corrigir agora vale antes mesmo de as análises terminarem.
