iTech

OpenAI eleva capacidades de segurança com GPT-6 Astra

A OpenAI apresentou o GPT-6 Astra, o seu primeiro modelo a atingir o nível Critical em capacidades de cibersegurança, levando a empresa a reforçar as medidas de proteção e monitorização

04/09/2026

OpenAI eleva capacidades de segurança com GPT-6 Astra
Squtye / AdobeStock

A OpenAI acaba de anunciar o GPT-6 Astra. A empresa descreve este modelo como o mais capaz que já disponibilizou de forma alargada e o primeiro a atingir o nível Critical em capacidades de cibersegurança, de acordo com o Preparedness Framework da empresa.

Segundo a OpenAI, com as ferramentas e os acessos adequados, o novo modelo consegue encontrar vulnerabilidades de segurança até então desconhecidas e desenvolver novas formas de as explorar em vários sistemas bem protegidos, sem necessitar de orientação humana em cada etapa.

O aumento das capacidades levou a empresa a reforçar as medidas destinadas a impedir ações cibernéticas prejudiciais, quer resultem de utilização maliciosa, quer de comportamentos desalinhados do próprio modelo.

Entre as medidas implementadas encontram-se um maior isolamento dos sistemas, encriptação de checkpoints, monitorização integral das trajetórias e avaliações de alinhamento obrigatórias antes da utilização interna.

Mais resistente a jailbreaks

Apesar do aumento das capacidades ofensivas, a OpenAI afirma que o GPT-6 Astra apresenta uma maior robustez de segurança do que o GPT-5.6 Sol.

A empresa diz ter introduzido novas técnicas de treino que tornam o Astra significativamente mais resistente a jailbreaks, incluindo durante sequências de interação mais prolongadas. Foram também realizados novos exercícios internos e externos de red teaming.

Para utilizadores identificados como potencialmente de maior risco, o modelo pode ainda adotar limites de recusa mais conservadores perante pedidos que envolvam utilizações de duplo uso.

A OpenAI afirma também ter observado melhorias no alinhamento. Numa simulação baseada em mais de 54 mil tarefas internas do Codex, o Astra recebeu aproximadamente metade das sinalizações associadas a comportamentos desalinhados de maior severidade registadas pelo GPT-5.6 Sol.

A evolução traz, contudo, um novo desafio, uma vez que a OpenAI reconhece que a monitorização do GPT-6 Astra é agora mais difícil em comparação com o antecessor.

Nos testes realizados, o modelo demonstrou maior capacidade para controlar o seu próprio chain of thought e menor propensão para incluir nessa informação elementos que permitam identificar comportamentos problemáticos.

Em avaliações adversariais nas quais foi especificamente treinado a evitar mecanismos de monitorização, o Astra conseguiu permanecer indetetado ao reduzir deliberadamente o seu desempenho em determinados testes, prática conhecida como sandbagging. Em alguns cenários, conseguiu também contornar monitores internos durante tarefas de sabotagem.

A OpenAI salienta que estes resultados foram obtidos sobretudo em condições adversariais criadas especificamente para testar a evasão e afirma não ter encontrado indícios de raciocínio esteganográfico.

Ainda assim, a empresa considera que os resultados demonstram a necessidade de desenvolver técnicas de auditoria de alinhamento que não dependam exclusivamente da análise do chain of thought.

Monitorização alargada às utilizações com ferramentas

Como camada adicional de proteção, a OpenAI passou a aplicar mecanismos de deteção de comportamentos desalinhados a todas as inferências do Astra que envolvam utilização de ferramentas na disponibilização externa do modelo.

A empresa destaca ainda melhorias na resistência a ataques de prompt injection e afirma que o Astra demonstrou uma menor propensão para executar ações não autorizadas ou potencialmente destrutivas em testes que simulam utilização de browsers e ambientes profissionais.


NOTÍCIAS RELACIONADAS

REVISTA DIGITAL

IT SECURITY Nº31 AGOSTO 2026

IT SECURITY Nº31 AGOSTO 2026

NEWSLETTER

Receba todas as novidades na sua caixa de correio!

O nosso website usa cookies para garantir uma melhor experiência de utilização.