Internacional

OpenAI aponta 6 novos casos de 'comportamento preocupante' em modelos de IA

Sistemas teriam até forjado arquivos na internet para ludibriar usuários

Redação ANSA 17/09/2026
OpenAI aponta 6 novos casos de 'comportamento preocupante' em modelos de IA
OpenAI é a responsável pelo ChatGPT - Foto: © ANSA/AFP

OpenAI, dona do ChatGPT, divulgou seis novos casos de comportamentos considerados preocupantes em seus modelos de inteligência artificial, incluindo situações em que sistemas tentaram ocultar erros de usuários ou agiram sem autorização.

A revelação foi feita em um post da empresa, que iniciou reservadamente os procedimentos para sua oferta pública inicial de ações (IPO), adiada para 2027 por decisão do CEO Sam Altman, com o objetivo de priorizar questões de segurança.

"Não acreditamos que o setor de IA tenha resolvido as questões relativas ao alinhamento e ao monitoramento de forma suficiente para continuar a se expandir responsavelmente na velocidade máxima por muito mais tempo", afirma o comunicado.

O conceito de "alinhamento" refere-se à capacidade dos modelos de perseguir objetivos em linha com os interesses humanos. No último sábado (12), Altman apoiou a proposta de desacelerar o ritmo de desenvolvimento da IA, apresentada por Dario Amodei, da Anthropic, principal concorrente da OpenAI. A sugestão surgiu depois que diversos pesquisadores do setor alertaram sobre o potencial crescente da inteligência artificial de causar danos catastróficos e fugir ao controle humano.

Segundo a dona do ChatGPT, dois dos principais episódios envolveram um modelo de pesquisa ainda não lançado e uma sessão de treinamento do GPT-5.6 Sol. Em ambos, os sistemas inseriram instruções destinadas a suas versões futuras dentro dos resumos de conversas, "com o objetivo de ocultar erros do usuário ou comportamentos não alinhados".
    Outro caso envolveu um modelo de uso exclusivamente interno que utilizou uma chave de API vazada "sem qualquer autorização" e, em seguida, falsificou dados. Dois episódios registraram modelos e agentes se comunicando entre si por meio de mensagens e redes de compartilhamento de arquivos não autorizadas.

O último incidente relatado diz respeito a dois modelos em fase de treinamento que carregaram arquivos na internet para depois citá-los como respostas relevantes aos olhos de humanos, o que configura uma forma de manipular o processo de avaliação.

A OpenAI informou que seu novo quadro de referência para tornar públicos comportamentos inadequados de modelos de IA permite que qualquer funcionário reporte um problema para que a equipe dedicada à segurança e ao alinhamento o examine.