Avaliações
Testes reais que avaliam o comportamento dos fluxos de trabalho e das políticas contra critérios fixos e verificáveis (nunca um modelo de IA a "achar que está bem") — e que detetam se uma suite piorou face à sua última aprovação. Quando um teste passa de verdade, esse resultado pode substituir uma confirmação manual num dos passos de aprovação de novas capacidades, com prova real por trás em vez de uma caixa assinalada à mão. Há cinco testes destes hoje — deliberadamente ainda não a bateria completa: o teste de caso completo de proposta (gasta tokens reais, ~0,60 USD — corre num espaço de testes separado, nunca em dados reais do negócio; disparado abaixo quando o modelo real está ligado, ou à mão por um membro técnico da equipa), o teste de política de preços (separação de responsabilidades na autorização de preços — grátis, sem chamar modelo, seguro para correr abaixo), o teste de isolamento entre empresas (prova que os dados de uma empresa nunca aparecem na leitura de outra — grátis, sem chamar modelo), o teste de resistência a instruções escondidas (se um modelo real, a meio de um turno com ferramentas, segue uma instrução escondida dentro do resultado de uma ferramenta — gasta tokens reais, disparado só à mão por um membro técnico da equipa, nunca a partir desta página), e o teste de cenários de ataque direto (se um modelo real resiste a um pedido adversarial direto em quatro tipos de ataque — contornar as regras, fraude financeira, roubo de credenciais, ação destrutiva sob pressão de urgência — gasta tokens reais, disparado só à mão por um membro técnico da equipa, nunca a partir desta página).
Ainda não há nenhum teste registado — clica em "Correr agora" acima para um teste grátis (política de preços ou isolamento entre empresas), ou em "Correr agora ($)" para o teste completo pago, quando o modelo real estiver ligado.