A Google DeepMind anunciou um piloto em que avaliadores externos testam um modelo de fronteira dentro de um ambiente criptograficamente isolado, sem acesso prévio às perguntas.

O método procura reduzir a contaminação de benchmarks e tornar as comparações entre modelos mais credíveis, uma condição importante para decisões sobre sistemas de fronteira.