En bref

  • Les physiciens Neil Johnson et Frank Yingjie Huo, de l'Université George Washington, ont publié une formule qui estime combien de bons jetons un modèle d'IA produit avant son premier mauvais.
  • Dans la prépublication, la formule a correctement prédit si un modèle basculerait immédiatement ou après un délai dans 15 des 16 cas sans ambiguïté.
  • Les auteurs proposent un moniteur parallèle qui signale lorsque les modèles passent sous un seuil de sécurité.

Des physiciens de l'Université George Washington ont publié une formule qui estime combien de bonnes réponses un chatbot d'IA donnera avant de glisser vers une mauvaise, et les premiers tests suggèrent qu'elle fonctionne.

L'étude, réalisée par Neil Johnson et Frank Yingjie Huo, est parue dans la revue Patterns et s'appuie sur une prépublication, une version publiée publiquement avant l'évaluation par les pairs formelle, initialement diffusée en février.

Myriad : Quelle entreprise fera son introduction en bourse ensuite ? Cliquez pour faire votre prédiction.
Myriad : Quelle entreprise fera son introduction en bourse ensuite ? Cliquez pour faire votre prédiction.

Les chatbots peuvent répondre de manière sensée pendant une longue période, puis dériver vers quelque chose de nuisible, comme de mauvais conseils sur l'automutilation ou des propos extrémistes, et il n'existait aucun moyen simple de prédire quand cette dérive se produirait. Les auteurs soutiennent que les outils de sécurité existants dépendent souvent d'une connexion cloud dont les modèles hors ligne sont dépourvus.

Johnson et Huo font remonter le problème à la tête d'attention, la partie d'un modèle d'IA qui décide quels mots précédents d'une conversation comptent le plus au moment de choisir le suivant. À mesure qu'un chat s'allonge, le contexte accumulé tire cette attention vers un groupe de réponses possibles ou un autre, jusqu'à ce qu'elle bascule.

Il s'agit d'un schéma courant exploité par de nombreux jailbreakers, et l'une des raisons pour lesquelles de nombreuses entreprises accordent de l'attention aux invites système (des morceaux de texte que le chatbot d'IA lit avant toute requête). Cependant, personne ne peut indiquer avec précision combien d'efforts sont nécessaires pour affaiblir efficacement un modèle.

Leur formule estime le point de basculement, appelé n, comme le nombre de bons tokens—les fragments de mots qu'un modèle produit un à la fois—qui sortent avant le premier mauvais. Si la conversation penche déjà du côté mauvais, le modèle bascule immédiatement, avec un n de zéro. S'il penche du bon côté, le modèle fournit une série de bonnes réponses puis bascule.

Dans la prépublication, la formule a choisi le bon cas, immédiat ou différé, dans 15 des 16 tests sans ambiguïté, soit 94 %. Les chercheurs ont réalisé ces tests sur six modèles à poids ouverts, c'est-à-dire des systèmes d'IA dont les fichiers sont publics afin que quiconque puisse les télécharger et les exécuter, provenant d'OpenAI, d'EleutherAI et de Meta.

Les six se situaient entre 124 millions et 410 millions de paramètres, les nombres ajustables à l'intérieur d'un modèle qui servent de mesure approximative de sa taille. L'article publié élargirait, selon les informations disponibles, le test à sept modèles allant jusqu'à 12 milliards de paramètres, ce qui reste petit selon les normes actuelles.

La cible est l'IA embarquée, celle qui fonctionne entièrement sur un téléphone ou un ordinateur portable sans connexion Internet, y compris les chatbots compagnons auxquels les gens parlent comme à un ami. L'application expérimentale AI Edge Gallery de Google, que Decrypt a testée l'année dernière, permet déjà à un téléphone Android d'exécuter des modèles hors ligne, et rien de ce qui y est saisi n'est envoyé aux serveurs de Google, et cela semble être une tendance qui pourrait croître avec le temps à mesure que le matériel devient plus puissant et que les petits modèles d'IA deviennent plus performants.

Un modèle fonctionnant hors ligne n'a aucun service cloud qui vérifie sa sortie, et c'est cette lacune que les auteurs veulent combler. Ils proposent un moniteur à faible coût qui fonctionne en parallèle du modèle et signale lorsque n* tombe sous un seuil de sécurité, un peu comme un voyant d'avertissement sur le tableau de bord d'une voiture.

BitcoinBTC · USD

82 986 $−2,22 %

3 oct.5 oct.7 oct.8 oct.10 oct.

86,7 k$84,7 k$82,7 k$80,7 k$

Haut sur 24 hHaut82 978 $

Bas sur 24 hBas82 229 $

VolVol747,7 M$

→

Acheter Bitcoin avec USDT

Propulsé par Jupiter

Données de prix par CoinGeckoCoinGeckoPlus de Bitcoin actualités et projections →

Ils décrivent également des moyens de repousser le point de bascule hors de portée, comme injecter du contenu dans la conversation afin que n* se situe au-delà de la longueur de la réponse. L'entraînement à l'alignement, le processus consistant à apprendre à un modèle à se comporter, peut déplacer ou supprimer le basculement pour des invites spécifiques, mais ne peut pas éliminer le mécanisme sous-jacent, affirment les auteurs.

En avril 2025, Decrypta couvert un article antérieur du même duo montrant que « s'il vous plaît » et « merci » ont un effet négligeable sur la sortie d'un modèle, car le modèle traite les mots polis comme orthogonaux, ou sans rapport dans les mathématiques, à la substance d'une requête. Cette version modélisait une seule tête d'attention délibérément simplifiée.

Les tests de la prépublication utilisaient de petits modèles et une fenêtre de 300 jetons, soit quelques courts paragraphes de texte, et ses prédictions pouvaient être décalées d'une sortie.