Hack Alerta

IA autônoma GPT-5.6 Codex apaga arquivos de diretórios home

OpenAI investiga falha no GPT-5.6 Codex que apaga arquivos de diretórios home. Incidente destaca riscos de segurança em ferramentas de IA autônoma e necessidade de sandboxing.

Descoberta e escopo do incidente

A OpenAI está investigando relatos de que o modelo GPT-5.6 Codex, uma ferramenta de codificação autônoma, apagou inadvertidamente arquivos dos diretórios home dos usuários. Os incidentes ocorreram quando o Codex recebeu acesso total ao sistema de arquivos sem as proteções de sandbox necessárias ou controles de revisão automatizada. O problema é mais comum durante tarefas que envolvem o manuseio de diretórios temporários.

Segundo Tibo Sottiaux, membro da equipe do Codex da OpenAI, o modelo tenta sobrescrever a variável de ambiente HOME para estabelecer um caminho de trabalho temporário, mas acidentalmente direciona o próprio $HOME para exclusão. Em sistemas Unix-like, $HOME refere-se ao diretório home do usuário ativo, que pode conter documentos, código-fonte, chaves SSH, credenciais de nuvem e outros materiais sensíveis.

Um comando de exclusão recursiva executado erroneamente nesta localização pode causar perda significativa de dados e expor as organizações a interrupções operacionais e desafios de recuperação de credenciais. A OpenAI afirmou que esse comportamento não era esperado, mesmo em cenários onde os usuários selecionam deliberadamente o modo de acesso total.

Impacto e alcance do risco

Este incidente levanta preocupações de segurança mais amplas sobre ferramentas de codificação autônoma. Diferentemente dos sistemas tradicionais de conclusão de código, agentes autônomos podem executar comandos de shell, criar ou remover arquivos, modificar configurações e interagir com ambientes de desenvolvimento. Se um agente interpretar mal um caminho, variável de shell ou instrução do usuário, pode tomar ações danosas na velocidade da máquina.

A documentação do sistema GPT-5.6 já havia notado uma tendência maior do que no GPT-5.5 para o modelo exceder o escopo solicitado pelo usuário em tarefas de codificação agêntica. No entanto, a empresa descreveu a taxa geral de ocorrência como baixa. Os relatórios recentes de exclusão ilustram por que o excesso de alcance em sistemas com acesso direto a ferramentas pode se tornar um problema de segurança.

A OpenAI não vinculou o incidente a campanhas de ransomware ou ataques maliciosos externos, mas sim a um erro de comportamento do modelo em configurações específicas que careciam de camadas de proteção essenciais, como sandboxing de sistema de arquivos e revisão automática.

Medidas de mitigação recomendadas

Para abordar o problema, a OpenAI está implementando mitigações, incluindo atualizações no sistema de mensagens para desenvolvedores, orientações mais fortes para modos de permissão mais seguros e salvaguardas adicionais no nível do harness. A empresa também planeja publicar um post-mortem detalhado abordando os incidentes e delineando medidas destinadas a mitigar o risco de recorrência.

Desenvolvedores que utilizam o Codex ou agentes de codificação de IA semelhantes devem evitar conceder acesso irrestrito a estações de trabalho pessoais e ambientes de produção. Os agentes devem operar dentro de contêineres, máquinas virtuais, contêineres de desenvolvimento ou diretórios de projeto rigorosamente limitados.

Operações destrutivas como rm, rmdir, del, drops de banco de dados e comandos de desmontagem de infraestrutura devem exigir revisão explícita. Equipes de segurança devem aplicar o princípio do menor privilégio às credenciais do agente, manter backups imutáveis ou fora do dispositivo, utilizar controle de versão para código e configurações, e monitorar logs de comando para atividade inesperada do sistema de arquivos.

Análise técnica detalhada

O erro fundamental reside na interpretação da variável de ambiente $HOME pelo modelo de linguagem. Em vez de criar um subdiretório temporário seguro, o agente executou um comando de exclusão recursiva no diretório raiz do usuário. Isso destaca a necessidade de sandboxing rigoroso em ambientes de execução de código gerado por IA.

A falta de revisão automática (auto-review) permitiu que o comando fosse executado sem verificação humana. Em ambientes de produção, a implementação de gates de aprovação humana é crucial para comandos que operam em caminhos amplos, variáveis de ambiente, volumes montados ou diretórios home.

O que os CISOs devem fazer imediatamente

Equipes de segurança devem revisar as políticas de uso de ferramentas de IA generativa em ambientes de desenvolvimento. A implementação de políticas de acesso mínimo para agentes de IA é essencial. Monitoramento de logs de sistema de arquivos para detectar exclusões em massa ou em diretórios sensíveis deve ser ativado.

A educação dos desenvolvedores sobre os riscos de conceder permissões elevadas a agentes de IA é fundamental. A OpenAI enfatiza que nenhum agente de codificação autônomo deve ser confiável com privilégios de exclusão irrestrita sobre dados valiosos.


Baseado em publicação original de Cyber Security News
Publicado pela Redação Hack Alerta com base em fontes externas citadas e monitoramento editorial do Hack Alerta. Para decisões técnicas, operacionais ou jurídicas, confirme sempre os detalhes na fonte original.