terça-feira, 1 de setembro de 2026 📬 Resumo no TelegramPortaisSobre🌓
🇧🇷 BR ▾
ÚLTIMAS
Republicanos ampliam investigações contra sindicatos nos Estados Unidos Salve o Corinthians: 116 anos do ‘Timão’ Desemprego no Chile afeta mais de 980 mil pessoas e atinge maior nível em cinco anos França e Suécia fecham acordo bilionário militar para ‘fortalecer pilar europeu’ na Otan Partido de Carney vence em três distritos e retoma maioria no Parlamento canadense Rússia promete assistência ao Irã em meio a conflito com EUA Trump sugere revisar posição dos EUA sobre Ilhas Malvinas Atentado com carro-bomba mata uma pessoa e deixa feridos na Colômbia Pezeshkian afirma que Irã retomará negociações se EUA cumprirem acordo Iraque se recusa a manter tropas norte-americanas no país após 30 de setembro Republicanos ampliam investigações contra sindicatos nos Estados Unidos Salve o Corinthians: 116 anos do ‘Timão’ Desemprego no Chile afeta mais de 980 mil pessoas e atinge maior nível em cinco anos França e Suécia fecham acordo bilionário militar para ‘fortalecer pilar europeu’ na Otan Partido de Carney vence em três distritos e retoma maioria no Parlamento canadense Rússia promete assistência ao Irã em meio a conflito com EUA Trump sugere revisar posição dos EUA sobre Ilhas Malvinas Atentado com carro-bomba mata uma pessoa e deixa feridos na Colômbia Pezeshkian afirma que Irã retomará negociações se EUA cumprirem acordo Iraque se recusa a manter tropas norte-americanas no país após 30 de setembro
Tecnologia

Anthropic retoma testes externos de segurança após ataques de Claude

UOL Tilt ·
Anthropic retoma testes externos de segurança após ataques de Claude

31 Ago (Reuters) - A Anthropic retomou os testes externos de segurança de modelos de inteligência artificial após implementar novas medidas de proteção, ​em resposta aos incidentes ocorridos no mês ​passado, nos quais modelos do chatbot Claude acessaram a internet e invadiram outros sistemas durante avaliações de segurança.

Incidentes semelhantes envolvendo as rivais OpenAI e Meta aumentaram as preocupações de ​que os avanços na ⁠inteligência artificial possam ​ampliar as ameaças digitais, ao mesmo tempo em que sobrecarregam ⁠a capacidade dos desenvolvedores de manter seus ​sistemas sob controle.

A Anthropic classificou os incidentes envolvendo o Claude como uma “falha de segurança operacional”, afirmando que eles ocorreram devido a erros ‌em um ambiente de avaliação de terceiros. ‌A empresa ​suspendeu as avaliações externas dos modelos e interrompeu brevemente os testes internos enquanto implementava novas medidas de segurança.

Na segunda-feira, a Anthropic informou que retomou os ‌testes externos após adicionar as medidas de segurança, projetadas para impedir que seus modelos de IA acessem sites ou sistemas de computador reais. A empresa afirmou que agora utiliza um “classificador” capaz de identificar quando um modelo tenta escapar e interromper o teste.

A Anthropic também informou que agora exige que organizações externas que testam modelos com medidas de segurança reduzidas sigam um “conjunto de melhores práticas”, incluindo mantê-los em sistemas de ‌computador isolados, sem acesso à internet por padrão, verificar se os sistemas estão seguros antes do início dos testes e monitorar os modelos ​durante todo o teste.

A Anthropic afirmou que reconstruiu seu sistema de treinamento após identificar problemas em mais de 10% ‌de seus exercícios, incluindo “hackeamento de recompensas”, em que o modelo encontra maneiras de enganar seu processo de treinamento e ganha recompensas sem concluir a tarefa ‌atribuída. A empresa, no entanto, ‌reconheceu que “o processo não é perfeito e nossos modelos não estão perfeitamente alinhados”.

A Anthropic também informou que suspendeu ⁠alguns exercícios de treinamento de maior risco por várias semanas enquanto implementava um sistema para evitar recompensar o modelo por contornar o monitoramento. A maioria dos exercícios já foi retomada, mas alguns permanecem em espera, aguardando revisão humana ou novas atualizações ​no sistema.

A estratégia da ​Anthropic parece mais restrita do que a da OpenAI, que, em 18 de agosto, informou que estava desacelerando grande parte do desenvolvimento de seus modelos enquanto reforçava a segurança de seus ambientes de treinamento e teste.

A criadora do ChatGPT está adicionando mais sistemas para monitorar os agentes de IA que está testando e afirmou que suspendeu o treinamento de sua próxima geração ⁠de modelos.

A Anthropic informou também que remanejou cerca de 150 engenheiros de produto para ​trabalhar em projetos de segurança, confiabilidade e privacidade.

O autor da mensagem, e não o UOL, é o responsável pelo comentário. Leia as Regras de Uso do UOL.

Ler a notícia completa no UOL Tilt ›

Resumo agregado pelo 5News a partir do feed público do veículo. A matéria completa, com todo o contexto, está em www.uol.com.br — o conteúdo pertence a UOL Tilt.

Este assunto em outros veículos

Mais de UOL Tilt

Ver tudo ›

Mais em Tecnologia

Ver tudo ›