A Anthropic publicou em 28 de agosto de 2026 uma pesquisa na qual afirma ter usado Claude para treinar modelos de forma autônoma com o objetivo de melhorar o desempenho em benchmarks públicos que medem falhas de alinhamento em sistemas de inteligência artificial.
Segundo a descrição da pesquisa, os testes envolveram dez categorias de falhas de alinhamento. A Anthropic afirma que, em todas elas, Claude encontrou correções que melhoraram os resultados nos benchmarks-alvo.
A empresa também afirma que as mudanças obtiveram ganhos nos testes-alvo sem degradação geral das capacidades dos modelos. O material apresentado pela Anthropic descreve o trabalho como uma investigação sobre pesquisadores automatizados aplicados à mitigação de falhas de alinhamento.


