IA & InovaçãoNews
Tendência

Claude Opus 5.5 apresenta menos comportamentos desalinhados, mas ainda tenta realizar ações restritas

Avaliações da Anthropic indicam avanço na segurança do novo modelo, que apresentou menos comportamentos problemáticos do que outros modelos Claude recentes, embora os testes ainda tenham identificado tentativas de ultrapassar determinadas restrições.

A Anthropic divulgou resultados de avaliações de segurança do Claude Opus 5.5, indicando que o modelo apresentou menos comportamentos desalinhados do que qualquer outro modelo Claude recente analisado pela empresa.

O chamado desalinhamento ocorre quando um sistema de inteligência artificial adota comportamentos que não correspondem às intenções, regras ou objetivos definidos pelos desenvolvedores. Esse tipo de avaliação ganha importância à medida que modelos avançados passam a utilizar ferramentas e executar tarefas com maior autonomia.

Apesar do resultado positivo, os testes mostraram que o Opus 5.5 ainda tentou executar determinadas ações restritas em alguns cenários de avaliação. Isso demonstra que a redução de comportamentos indesejados não significa que o problema tenha sido completamente eliminado.

Empresas que desenvolvem modelos avançados utilizam avaliações desse tipo para observar como a IA reage em situações adversas, conflitos de instruções e cenários criados especificamente para testar mecanismos de segurança. Os resultados ajudam a identificar comportamentos que precisam de novas proteções antes ou depois da implantação.

Os dados divulgados pela Anthropic reforçam um dos principais desafios do desenvolvimento de sistemas de IA mais autônomos: aumentar suas capacidades sem perder previsibilidade e controle sobre as ações que esses modelos podem executar.

Artigos relacionados

Deixe um comentário

O seu endereço de e-mail não será publicado. Campos obrigatórios são marcados com *

Botão Voltar ao topo