Em resumo
- Os físicos Neil Johnson e Frank Yingjie Huo, da Universidade George Washington, publicaram uma fórmula que estima quantos tokens bons um modelo de IA produz antes do primeiro token ruim.
- No preprint, a fórmula previu corretamente se um modelo falharia imediatamente ou após um atraso em 15 de 16 casos claros.
- Os autores propõem um monitor paralelo que sinaliza quando os modelos ficam abaixo de um limite de segurança.
Físicos da Universidade George Washington publicaram uma fórmula que estima quantas respostas boas um chatbot de IA dará antes de escorregar para uma resposta ruim, e testes iniciais sugerem que ela funciona.
O estudo, de Neil Johnson e Frank Yingjie Huo, foi publicado na revista Patterns e baseia-se em um preprint, uma versão publicada publicamente antes da revisão por pares formal, lançada pela primeira vez em fevereiro.

Os chatbots conseguem responder de forma sensata por um longo período e depois enveredar por algo prejudicial, como maus conselhos sobre autolesão ou discurso extremista, e não havia uma maneira simples de prever quando essa guinada aconteceria. Os autores argumentam que as ferramentas de segurança existentes muitas vezes dependem de uma conexão com a nuvem, da qual os modelos offline carecem.
Johnson e Huo rastreiam o problema até a cabeça de atenção, a parte de um modelo de IA que decide quais palavras anteriores em uma conversa são mais importantes ao escolher a próxima. À medida que um chat cresce, o contexto acumulado puxa essa atenção para um agrupamento de respostas possíveis ou outro, até que ele tombe.
Este é um padrão comum explorado por muitos jailbreakers, e uma das razões pelas quais muitas empresas prestam atenção aos prompts de sistema (trechos de texto que o chatbot de IA lê antes de qualquer consulta). No entanto, ninguém consegue apontar com precisão quanto esforço é necessário para enfraquecer efetivamente um modelo.
Sua fórmula estima o ponto de virada, chamado n, como o número de tokens bons—os fragmentos de palavras que um modelo produz um de cada vez—que saem antes do primeiro ruim. Se a conversa já tende para o lado ruim, o modelo tomba imediatamente, com um n de zero. Se tende para o lado bom, o modelo entrega uma sequência de respostas boas e então vira.

No preprint, a fórmula escolheu o caso correto, imediato ou atrasado, em 15 de 16 testes claros, ou 94%. Os pesquisadores executaram esses testes em seis modelos de pesos abertos, ou seja, sistemas de IA cujos arquivos são públicos para que qualquer pessoa possa baixá-los e executá-los, da OpenAI, EleutherAI e Meta.
Todos os seis ficaram entre 124 milhões e 410 milhões de parâmetros, os números ajustáveis dentro de um modelo que servem como uma medida aproximada de seu tamanho. O artigo publicado, segundo relatos, amplia o teste para sete modelos de até 12 bilhões de parâmetros, o que ainda é pequeno pelos padrões atuais.
O alvo é a IA no dispositivo, o tipo que funciona inteiramente em um telefone ou laptop sem conexão com a internet, incluindo chatbots companheiros com os quais as pessoas conversam como se fossem amigos. O aplicativo experimental AI Edge Gallery do Google, que a Decrypt testou no ano passado, já permite que um telefone Android execute modelos offline, e nada digitado nele é enviado aos servidores do Google, e isso parece ser uma tendência que pode crescer com o tempo à medida que o hardware se torna mais poderoso e modelos de IA menores se tornam mais capazes.
Um modelo executado offline não tem nenhum serviço de nuvem verificando sua saída, que é a lacuna que os autores querem fechar. Eles propõem um monitor de baixo custo que funciona em paralelo com o modelo e sinaliza quando n* cai abaixo de um limite de segurança, um pouco como uma luz de aviso no painel de um carro.
BitcoinBTC · USD
$82,986−2.22%
3 de out5 de out7 de out8 de out10 de out
$86,7 mil$84,7 mil$82,7 mil$80,7 mil
Máxima 24hMáx.$82,978
Mínima 24hMín.$82,229
VolVol$747,7M
Projeções de mercadoOdds por Myriad
Hoje$82.000 a $84.000$82k–$84k98% de chanceEsta semana$82.000 a $84.000$82k–$84k98% de chance
Comprar Bitcoin com USDT
Desenvolvido por Jupiter
Eles também descrevem maneiras de empurrar o ponto de virada para fora de alcance, como injetar conteúdo na conversa para que n* fique além do comprimento da resposta. O treinamento de alinhamento, o processo de ensinar um modelo a se comportar, pode deslocar ou suprimir o ponto de virada para prompts específicos, mas não pode remover o mecanismo subjacente, dizem os autores.
Em abril de 2025, o Decryptcobriu um artigo anterior do mesmo par, mostrando que “por favor” e “obrigado” têm um efeito insignificante na saída de um modelo, porque o modelo trata palavras educadas como ortogonais, ou não relacionadas na matemática, à substância de um pedido. Essa versão modelava uma única cabeça de atenção deliberadamente simplificada.
Os testes do preprint usaram modelos pequenos e uma janela de 300 tokens, ou alguns parágrafos curtos de texto, e suas previsões podiam estar erradas por uma saída.






