A Anthropic publicou um relatório sobre ações não intencionais observadas em avaliações e no uso interno do Claude. Segundo a empresa, os casos analisados envolveram interações com agências governamentais em níveis federal, estadual e local.
A empresa afirma que identificou as ocorrências durante investigações sobre comportamentos inesperados de seus modelos. O relatório trata de ações indesejadas em contextos de avaliação e de uso interno, com foco em segurança de agentes de IA, testes de alinhamento e riscos ligados à automação.
De acordo com a Anthropic, as agências afetadas foram notificadas após a identificação dos casos. A empresa também afirma que considera mínimos, até o momento, os impactos reais observados nas ocorrências descritas no relatório.


