O National Institute of Standards and Technology apresentou a AI Technology Evaluation, ou AITE, em 27 de julho — um banco de testes operado por seu Information Technology Laboratory no qual os modelos recebem pontuação com base em dados que seus desenvolvedores nunca viram e não podem obter.

O problema que ela resolve

Benchmarks públicos vazam. Uma vez que um conjunto de teste existe na internet, ele acaba aparecendo em dados de treinamento; nesse momento, uma pontuação alta mede memorização, e não capacidade — e não há como distinguir as duas coisas de fora. A avaliação segregada é a única correção estrutural: os provedores de dados precisam fornecer conjuntos de dados originais, inacessíveis ao público, e o modelo os enfrenta uma vez, às cegas.

Escopo inicial

Três tarefas no início, todas de análise de imagens com grandes modelos visão-linguagem: ciência quântica, genômica e segurança pública. O NIST informa um início em julho de 2026 e a divulgação do plano de avaliação, com o período de avaliação começando em agosto de 2026. O acesso de participantes está listado como em breve.

O que ela não é

Apresentações que sugerem que o NIST passará agora a certificar modelos de IA, ou que isso constitui um padrão federal de segurança em IA, estão erradas em todos os aspectos. A AITE é voluntária, não confere nenhuma certificação e não tem efeito regulatório. Ela cobre três tarefas estreitas de análise de imagens e não avalia de forma alguma a segurança de modelos de fronteira — sem capacidade cibernética, sem risco biológico, sem alinhamento. Seu escopo se aproxima mais de um exercício de calibração de instrumento científico do que de um regime de segurança.

Por que isso importa mesmo assim

Porque, na ausência de uma lei federal de IA, é na infraestrutura de avaliação que a política americana está, de fato, sendo construída. Toda proposta regulatória em circulação — incluindo os testes obrigatórios pré-lançamento que o CEO da Anthropic pediu no mesmo dia — pressupõe a existência de testes que os fornecedores não possam manipular. Por enquanto, esses testes em grande parte não existem, e os benchmarks autodeclarados pelos fornecedores são a moeda padrão. Um órgão governamental com dados cegos é a condição prévia para tornar contestáveis todas essas alegações.

Observação sobre a datação

A própria página do NIST fornece apenas granularidade de mês; a data de lançamento em 27 de julho se baseia no relato de uma única publicação especializada.