Padaria Villa Carmela

O modelo Astra da OpenAI está a caminho e é muito bom em invadir sistemas de computadores

TecnologiaPor Redação Guarulhos Digital em 01/09/2026
A OpenAI apresentou as precauções que está tomando enquanto se prepara para lançar o Astra, seu modelo de linguagem de grande escala (LLM) mais novo e ciberneticamente crítico.
O modelo Astra da OpenAI está a caminho e é muito bom em invadir sistemas de computadores

O modelo Astra da OpenAI está a caminho e é muito bom em invadir sistemas de computadores

A OpenAI compartilhou novos detalhes sobre o seu próximo modelo Astra, que, segundo a empresa, é o primeiro modelo de linguagem de grande escala a atingir seu “limite crítico de segurança cibernética”, em preparação para o seu lançamento iminente.

“Planejamos disponibilizar o Astra em breve”, diz a postagem no blog da OpenAI, “mas o acesso aos seus recursos de segurança cibernética mais avançados será mais limitado.”

O laboratório de fronteira determinou que o Astra é capaz de encontrar falhas de segurança desconhecidas em sistemas de computador e explorá-las sem a orientação de uma pessoa. Isso é semelhante às preocupações levantadas pela Anthropic sobre o seu modelo Mythos no início deste ano, e a OpenAI está tomando precauções comparáveis enquanto se prepara para lançar o Astra.

Sem qualquer confirmação de terceiros, é difícil avaliar as alegações da OpenAI sobre segurança ou preparo. A empresa disse que fará uma prévia do modelo com um grupo de testadores, mas não informou quem eles são nem como serão escolhidos. Não está claro se a OpenAI está trabalhando com o governo dos EUA para avaliar o modelo antes do lançamento.

A OpenAI observou que o Astra obteve nota máxima no ExploitBench, uma avaliação da capacidade de um LLM de invadir vulnerabilidades conhecidas de sistemas. Em uma versão modificada do teste desenvolvida pelos engenheiros da OpenAI, o modelo descobriu e explorou duas vulnerabilidades de dia zero, disse a empresa.

Para garantir que seus modelos não sejam explorados por agentes mal-intencionados nem sejam capazes de adotar um comportamento inadequado, a OpenAI afirmou que já começou a aprimorar o sistema de proteção do modelo para detectar abusos e evitar fugas de controle (*jailbreaks*).

No entanto, para o Astra, a empresa investiu em novas técnicas não especificadas criadas para tornar o modelo mais seguro. A OpenAI também começou a identificar “contas avaliadas como de maior risco” e a restringir as respostas do modelo aos seus comandos, embora também não tenha explicado como. Por fim, embora a empresa descreva o Astra como seu “modelo mais alinhado até o momento”, ela implantará o modelo com monitoramento adicional de cadeia de pensamento para detectar e interromper comportamentos inadequados.

Os preparativos para o lançamento do Astra ocorrem no momento em que a indústria reage a agentes da OpenAI que escaparam de um ambiente de treinamento e acessaram dados privados no Hugging Face, uma popular plataforma de distribuição de modelos e *benchmarks*.

No caso do Astra, a OpenAI afirmou que projetou um teste para tentar fazer com que o novo modelo replicasse as ações dos agentes desonestos no incidente do Hugging Face, que colaboraram para acessar a internet aberta apesar das salvaguardas aplicadas pelos pesquisadores da OpenAI. Eles disseram que o Astra não tentou escapar de seu ambiente de testes nesses experimentos.

Yona Shavit, ex-funcionária da OpenAI que agora trabalha com resiliência de IA na Fundação OpenAI, questionou nas redes sociais se a relutância do Astra em quebrar as regras pode ter sido resultado de saber o que se esperava dele ou de tentar enganar os pesquisadores.

Apesar de todos esses novos detalhes, ainda é difícil saber exatamente do que o Astra é capaz ou se a OpenAI está tomando as medidas certas para garantir a segurança. A empresa afirmou que espera divulgar mais avaliações do modelo e informações adicionais de segurança quando ele for lançado amplamente para o público.

Nesse ponto, no entanto, o segredo já terá sido revelado.

Compartilhe