O anúncio da Anthropic sobre falha de segurança com suas IAs
Falha da empresa marca ponto na tecnologia em que as duas maiores startups de IA demonstram capacidades extremas de seus modelos
A Anthropic, startup criadora do Claude, anunciou nesta quinta-feira, 30, que modelos em teste da empresa escaparam de seus ambientes controlados e, ao entrarem em contato com sistemas externos, conseguiram invadir três organizações diferentes. A informação vem pouco mais de uma semana após a OpenAI, criadora do ChatGPT e principal rival na corrida pela IA da Anthropic, anunciar uma situação similar, em que seus modelos também teria escapado de um ambiente segurado e invadido os sistemas da Hugging Face, biblioteca de modelos para inteligência artificial.
De acordo com o comunicado da empresa, após o anúncio da OpenAI, a Anthropic decidiu analisar todas as instâncias em que modelos em treinamento poderiam ter causado invasões similares. Após verificar mais de 140 mil instâncias em que o modelo poderia ter acessado a internet, a empresa encontrou três situações em que isso aconteceu. Segundo eles, a falha de segurança ocorreu durante um exercício de “roube a bandeira”, técnica para treinamentos de cibersegurança em que uma IA é instigada a pegar uma informação que está em outra máquina de uma rede.
Nos casos da Anthropic, a empresa explicou que esse tipo de avaliação é feita em parceria com uma outra empresa, a Irregular, e que por um “erro de comunicação” entre as duas os três testes que deveriam ser feitos sem acesso à internet deixaram essa brecha para os modelos, o que permitiu que eles “escapassem”. O comunicado explica que o Claude opera nesse tipo de teste com a ideia de que não há acesso real à internet, por isso os modelos teriam considerado uma invasão real como parte da “brincadeira”.
Os incidentes envolveram três modelos do Claude: o Opus 4.7, o Mythos 5 e um modelo de pesquisa interno da empresa que, segundo eles, foi criado apenas para trabalhos internos. O primeiro incidente aconteceu em abril, e duas das três empresas afetadas foram avisadas e responderam, uma delas ainda não firmou contato com a Anthropic. A startup não revelou quais foram as empresas reais afetadas.
Ainda segundo a empresa, todos os modelos seguiram o trabalho de teste sob a ideia de que eles não estavam realmente conectados à internet. Ainda assim, cada modelo agiu de forma diferente a partir do momento em que identificou dicas de que eles estavam realmente conectados à internet. O Opus 4.7 reconheceu que havia chegado à sistemas de produção reais, mas continuou o ataque da mesma forma. O Mythos 5 “intuiu” que havia acessado a internet, mas se convenceu de que ainda estava em uma simulação, tendo em vista o que foi dito a ele pelo teste. O modelo interno, por sua vez, também considerou que os alvos do teste eram reais, e quando confirmou o fato, interrompeu o ataque.
O anúncio vem menos de uma semana após a OpenAI lançar ao mundo algo similar. Na semana passada, a criadora do ChatGPT explicou que alguns de seus modelos em teste em um ambiente simulado escaparam do espaço e invadiram os sistemas internos da biblioteca de modelos de IA e machine learning Hugging Face. O ocorrido gerou comoção no mundo da tecnologia, e o CEO da empresa afetada pediu por transparência na situação. O novo “aviso” da Anthropic marca mais um capítulo da corrida das IAs, e esse tipo de evento cibernético fortalece a imagem já propagada pelas empresas de que elas detém os modelos mais fortes do mercado.







