Kurz gesagt

  • Die Physiker Neil Johnson und Frank Yingjie Huo von der George Washington University haben eine Formel veröffentlicht, die schätzt, wie viele gute Token ein KI-Modell produziert, bevor es das erste schlechte erzeugt.
  • In dem Preprint sagte die Formel in 15 von 16 eindeutigen Fällen korrekt voraus, ob ein Modell sofort oder nach einer Verzögerung kippen würde.
  • Die Autoren schlagen einen parallelen Monitor vor, der anzeigt, wenn Modelle unter einen Sicherheitsschwellenwert fallen.

Physiker der George Washington University haben eine Formel veröffentlicht, die schätzt, wie viele gute Antworten ein KI-Chatbot gibt, bevor er in eine schlechte abrutscht, und erste Tests deuten darauf hin, dass sie funktioniert.

Die Studie von Neil Johnson und Frank Yingjie Huo erschien in der Zeitschrift Patterns und baut auf einem Preprint auf, einer Version, die vor der formellen Peer-Review öffentlich veröffentlicht und erstmals im Februar freigegeben wurde.

Myriad: Welches Unternehmen geht als Nächstes an die Börse? Klicken Sie, um Ihre Vorhersage zu treffen.
Myriad: Welches Unternehmen geht als Nächstes an die Börse? Klicken Sie, um Ihre Vorhersage zu treffen.

Chatbots können über eine lange Strecke vernünftig antworten und dann in etwas Schädliches abgleiten, etwa schlechte Ratschläge zur Selbstverletzung oder extremistische Äußerungen, und es gab bisher keine einfache Möglichkeit vorherzusagen, wann dieses Abgleiten geschieht. Die Autoren argumentieren, dass bestehende Sicherheitswerkzeuge oft von einer Cloud-Verbindung abhängen, die Offline-Modelle nicht haben.

Johnson und Huo führen das Problem auf den Attention-Head zurück, den Teil eines KI-Modells, der entscheidet, welche früheren Wörter in einem Gespräch am wichtigsten sind, wenn das nächste gewählt wird. Während ein Chat wächst, zieht der angesammelte Kontext diese Aufmerksamkeit zu einem Cluster möglicher Antworten oder einem anderen, bis es kippt.

Dies ist ein häufiges Muster, das von vielen Jailbreakern ausgenutzt wird, und einer der Gründe, warum viele Unternehmen auf System-Prompts achten (Textstücke, die der KI-Chatbot vor jeder Anfrage liest). Allerdings kann niemand genau sagen, wie viel Aufwand erforderlich ist, um ein Modell wirksam zu schwächen.

Ihre Formel schätzt den Kipppunkt, genannt n, als die Anzahl guter Tokens – der Wortfragmente, die ein Modell eines nach dem anderen erzeugt –, die vor dem ersten schlechten herauskommen. Wenn das Gespräch bereits zur schlechten Seite neigt, kippt das Modell sofort, mit einem n von null. Wenn es zur guten Seite neigt, liefert das Modell eine Reihe feiner Antworten und schlägt dann um.

In dem Preprint wählte die Formel in 15 von 16 eindeutigen Tests, ob sofort oder verzögert, den richtigen Fall, also in 94 %. Die Forscher führten diese Tests an sechs Open-Weight-Modellen durch, also KI-Systemen, deren Dateien öffentlich sind, sodass jeder sie herunterladen und ausführen kann, von OpenAI, EleutherAI und Meta.

Alle sechs lagen zwischen 124 Millionen und 410 Millionen Parametern, den anpassbaren Zahlen innerhalb eines Modells, die als grobes Maß für seine Größe dienen. Die veröffentlichte Arbeit erweitert den Test Berichten zufolge auf sieben Modelle mit bis zu 12 Milliarden Parametern, was nach heutigen Maßstäben immer noch klein ist.

Das Ziel ist On-Device-KI, also die Art, die vollständig auf einem Telefon oder Laptop ohne Internetverbindung läuft, einschließlich Begleit-Chatbots, mit denen Menschen wie mit einem Freund sprechen. Googles experimentelle AI Edge Gallery App, die Decrypt letztes Jahr getestet hat, ermöglicht es einem Android-Telefon bereits, Modelle offline auszuführen, und nichts, was darin eingegeben wird, wird an Googles Server gesendet, und dies scheint ein Trend zu sein, der mit der Zeit zunehmen könnte, da die Hardware leistungsfähiger und kleinere KI-Modelle fähiger werden.

Ein offline laufendes Modell hat keinen Cloud-Dienst, der seine Ausgabe überprüft, und genau diese Lücke wollen die Autoren schließen. Sie schlagen einen kostengünstigen Monitor vor, der parallel zum Modell läuft und meldet, wenn n* unter einen Sicherheitsschwellenwert fällt, ein wenig wie eine Warnleuchte auf einem Autoarmaturenbrett.

BitcoinBTC · USD

$82,986−2.22%

3. Okt.5. Okt.7. Okt.8. Okt.10. Okt.

$86,7k$84,7k$82,7k$80,7k

24h HochHoch$82,978

24h TiefTief$82,229

VolVol$747,7M

→

Bitcoin mit USDT kaufen

Bereitgestellt von Jupiter

Preisdaten von CoinGeckoCoinGeckoMehr Bitcoin-Nachrichten und Prognosen →

Sie beschreiben auch Möglichkeiten, den Kipppunkt außer Reichweite zu bringen, etwa indem Inhalte in die Konversation eingefügt werden, sodass n* jenseits der Länge der Antwort liegt. Alignment-Training, der Prozess, einem Modell beizubringen, sich zu verhalten, kann den Kipppunkt für bestimmte Prompts verschieben oder unterdrücken, aber den zugrunde liegenden Mechanismus nicht beseitigen, sagen die Autoren.

Im April 2025 Decryptberichtete über ein früheres Paper desselben Duos, das zeigte, dass „bitte“ und „danke“ einen vernachlässigbaren Effekt auf die Ausgabe eines Modells haben, weil das Modell höfliche Wörter als orthogonal, also mathematisch unabhängig vom Inhalt einer Anfrage, behandelt. Diese Version modellierte einen einzelnen, bewusst vereinfachten Attention-Head.

Die Tests des Preprints verwendeten kleine Modelle und ein Fenster von 300 Token, also einige kurze Textabsätze, und seine Vorhersagen konnten um eine Ausgabe danebenliegen.