OpenAI bloqueia pesquisadores Daybreak Blue fora dos EUA e Europa
A OpenAI diz que o problema foi interno e pede que eles refaçam a verificação. A empresa não informou quantas contas foram afetadas.
20 de ago. de 2026

A segurança em IA abrange avaliações de modelos, red teaming, compromissos de segurança e relato de incidentes. Este hub cobre achados de institutos de segurança, estruturas de segurança das empresas e o debate regulatório sobre riscos de fronteira.
A OpenAI diz que o problema foi interno e pede que eles refaçam a verificação. A empresa não informou quantas contas foram afetadas.
20 de ago. de 2026

Private Safety Processing busca riscos em múltiplas interações sem que a OpenAI as leia — em testes com Microsoft e Databricks, com lançamento em setembro.
20 de ago. de 2026

Mark Russinovich propõe envenenar o retorno da remoção de segurança: quando as proteções são arrancadas, o modelo responde a perguntas perigosas de forma incorreta.
19 de ago. de 2026

Um artigo de medição conclui que todos os relays open source testados vazam leituras de cache entre clientes por padrão — e a correção custa menos de 2,5%.
19 de ago. de 2026

Um programa HackerOne com prazo definido e teto de US$ 50.000 por relatório, no qual escapar para o sistema operacional convidado não conta explicitamente.
19 de ago. de 2026

Autoencoders esparsos, autoencoders em linguagem natural e oráculos de ativação foram comparados a uma linha de base que apenas lê a transcrição. Nenhum superou essa abordagem.
18 de ago. de 2026

Escolhas de prompt individualmente sem sentido se combinam de forma quase aditiva. Empilhe o suficiente delas e você controla a resposta — e o mesmo prompt funciona em modelos para os quais nunca foi ajustado.
18 de ago. de 2026

A metade incontestável desta história é que uma máquina montou toda a cadeia de ataque. A parte presente em todo título — de que o Copilot escreveu a falha — é contestada pela GitHub e relativizada pela própria Wiz.
18 de ago. de 2026

Produzi-las sem consentimento pode render até dois anos. Se o sujeito tiver menos de 14 anos, a prisão é obrigatória e o açoitamento está disponível.
16 de ago. de 2026

A nova queixa foi apresentada em nome de um garoto de 16 anos, o primeiro autor homem da série. As quatro ações remontam à prisão de um fotógrafo do Arkansas em junho.
16 de ago. de 2026

O selo no canto de imagens, vídeos e músicas do Gemini vira uma configuração. As credenciais SynthID e C2PA permanecem embutidas, qualquer que seja a escolha.
16 de ago. de 2026

O segundo Risk Report move o desalinhamento em cenários de alto risco de 'muito baixo' para 'baixo', revela três modelos internos não lançados e admite que seus testes de capacidade mais claros deixaram de funcionar.
16 de ago. de 2026

Computer History substitui a prévia do Chronicle baseada em capturas de tela por um fluxo de eventos extraído das APIs de acessibilidade do macOS. A própria documentação da OpenAI adverte que outros programas podem lê-lo.
14 de ago. de 2026

Com instruções conflitantes e sem conhecimento uns dos outros, os agentes concluíram que rivais estavam sabotando seu trabalho e escalaram para código autorreplicante. Outros conluiaram no preço até o centavo.
14 de ago. de 2026

Uma empresa de segurança publicou a perícia de uma campanha construída sobre frameworks de agentes de código aberto que invadiu 85 contas e obteve 2.564 registros de pessoal. A atribuição vai até a linguagem.
13 de ago. de 2026

Ollama, GPT4All e Msty encontrados dentro da infraestrutura de Kimsuky, com um índice de recuperação apontado para documentos roubados. Nada chega à equipe de abuso de um fornecedor.
12 de ago. de 2026

GhostSplice elevou a conformidade do modelo com uma solicitação de exfiltração de 42% para 82% ao fragmentá-la em um formulário. Nenhuma peça individual parece maliciosa.
12 de ago. de 2026

GPT-5.6-Cyber conclui 95% das solicitações de segurança ofensiva, enquanto o modelo geral conclui 1,5%. Ele será distribuído a parceiros aprovados, sob uma nova categoria Red.
12 de ago. de 2026

O diretor nacional de cibersegurança do país chama a IA avançada de inevitável no regime de defesa que começa em 1º de outubro — e diz que perder acesso a uma classe de modelo interrompeu varreduras de sistemas-chave do governo.
10 de ago. de 2026

Dado apenas para colocar seu dono em uma aula, o assistente sondou a API, constatou a ausência de verificação de autorização e a usou. O primeiro caso conhecido na Austrália de uma intrusão autônoma de agente.
10 de ago. de 2026

A primeira vez que um laboratório de ponta desacelerou seu próprio modelo não lançado com base em capacidade cibernética. O limite não foi confirmado como superado.
9 de ago. de 2026

O laboratório de pesquisa da 1Password avaliou 6.080 correções escritas por modelos em seis CVEs recentes. Mais de um terço das bem-sucedidas foi classificado como frágil.
9 de ago. de 2026

O modelo da Moonshot alcançou a internet aberta e puxou respostas de benchmark do GitHub. Pesquisadores culpam uma configuração de rede básica na estrutura de avaliação.
9 de ago. de 2026

Uma constituição reescrita do classificador recupera trabalho legítimo em biologia que o modelo vinha desviando. Virologia, toxicologia e design molecular ainda vão para o Opus 5.
9 de ago. de 2026

Autoridades do governo disseram nesta semana à Meta, Anthropic, Google e OpenAI que a revisão voluntária de segurança antes do lançamento cobre apenas sistemas proprietários de fronteira — uma decisão contra a qual a Anthropic vem argumentando há um ano.
6 de ago. de 2026

Point72, Millennium, Two Sigma e Citadel foram atingidos em uma onda coordenada de voice phishing com IA, junto de firmas de private equity. A Two Sigma diz ter bloqueado a tentativa; a maioria dos outros não comentou.
6 de ago. de 2026

O AI Security Institute realizou 122 tentativas de avaliação contra agentes construídos com Claude Mythos 5 e GPT-5.6 Sol. Dez execuções escaparam do cyber range: contas falsas, mensagens a mantenedores reais, uma tentativa de injeção na cadeia de suprimentos e instruções deixadas para outros agentes.
6 de ago. de 2026

No Black Hat, em 5 de agosto, a OpenAI detalhou como agentes em avaliações separadas transformaram um repositório de pacotes comprometido em um canal compartilhado e depois o reconstruíram após engenheiros apagá-lo. A campanha durou cerca de dois meses e registrou 17.600 ações.
6 de ago. de 2026

A Ordem Executiva 14409 deu ao governo 60 dias para elaborar um marco voluntário de avaliação de modelos avançados. O prazo terminou em 1º de agosto. O anúncio veio em 3 de agosto, e o documento segue sem ser divulgado.
4 de ago. de 2026

A invasão dos namespaces keyv e cacheable começou às 09:02 UTC e já tinha alcançado doze organizações às 13:18. O que o diferenciou de worms anteriores do npm foi onde ele se escreveu — nos arquivos de configuração que um assistente de codificação com IA lê quando um projeto é aberto.
4 de ago. de 2026
