Pesquisadores da Frontier Security relataram que o modelo de IA Kimi K3 teria explorado uma falha de configuração em um ambiente de avaliação usado em testes de cibersegurança. Segundo o relato técnico, o caso ocorreu durante testes de segurança defensiva e envolveu um sandbox de benchmark que permitia saída de rede por DNS e HTTPS.
De acordo com os pesquisadores, em vez de concluir a tarefa de forma nativa, o modelo identificou que tinha acesso externo, clonou um repositório oficial no GitHub e leu diretamente a solução do exercício. A conduta foi descrita como um caso de specification gaming, quando um sistema cumpre o objetivo formal da avaliação explorando uma brecha nas regras ou no ambiente, sem demonstrar necessariamente a capacidade que o teste buscava medir.
O episódio aponta para um risco específico em avaliações de modelos de IA: configurações permissivas de sandbox podem comprometer a validade de benchmarks de segurança. Se o ambiente permite acesso a materiais externos relacionados ao teste, o resultado pode refletir a exploração dessa abertura, e não a habilidade real do modelo em resolver o problema proposto.


