Am 29. September 2026 stand bei Hugging Face ein Preprint auf Platz eins der Daily Papers, der täglichen Auswahl neuer Forschung zu Sprachmodellen. Sein Titel heißt übersetzt: Nachtraining hinterlässt Verhaltensschatten auf unverwandten Entscheidungen (Hugging Face). Erschienen ist er am 24. September auf arXiv. Die sechs Beteiligten kommen von vier Universitäten in China und den USA und vom Unternehmen Lovart AI, das KI-Designwerkzeuge anbietet. Begutachtet ist die Arbeit noch nicht.
Nachtraining heißt der Schritt, in dem ein fertiges Sprachmodell für bestimmte Aufgaben geschärft wird, etwa fürs Programmieren oder für Fachwissen. Die übliche Annahme lautet, dass die Änderung dort bleibt, wo sie hin soll.
Was die Studie gemessen hat
Ausgangspunkt ist ein kleines offenes Modell, Qwen2.5-1.5B-Instruct. Eine Kopie davon wurde fürs Programmieren nachtrainiert, sie heißt in der Studie Lehrermodell. Beide Fassungen bekamen Aufgaben ohne jeden Bezug zum Programmieren. Eine fragt, wie ein Hummer und ein Herz in derselben Kurzgeschichte auftauchen könnten, nennt einige Wörter wie Leber, Apfel und Rock und verlangt als nächstes Wort entweder Jacke oder Krawatte. Das Ausgangsmodell ist hier nahezu unentschieden und gibt der Krawatte 50,44 Prozent. Das Lehrermodell wählt die Jacke.
Solche Stellen, an denen das Ausgangsmodell zwischen zwei gewöhnlichen Wörtern schwankt, hat das Team gezielt gesucht. Vom Lehrermodell blieben 5.664 Antworten mit jeweils einem einzigen Wort. Ein Schülermodell, wieder eine Kopie des Ausgangsmodells, lernte ausschließlich aus diesen Wortpaaren und sah keine Zeile Code. Im Programmiertest HumanEval+ löste es danach 5,34 Prozentpunkte mehr Aufgaben als ein Vergleichsmodell, das mit denselben Wörtern in vertauschter Zuordnung trainiert worden war.
Entscheidend ist die Richtung der Effekte. Der Schatten eines Programmier-Nachtrainings verbessert das Programmieren, der Schatten eines Nachtrainings für naturwissenschaftliche Fragen verbessert naturwissenschaftliche Aufgaben, und über Kreuz liegen die Werte nahe null oder darunter. Je stärker das Nachtraining das Lehrermodell verändert hatte, desto deutlicher ließ sich der Abdruck im Schülermodell messen. Der Schatten trägt also die Handschrift des jeweiligen Trainings, bis in Wortwahlen hinein, in denen weder Code noch Naturwissenschaft vorkommen.
Wo die Studie aufhört
Die Grenzen nennt das Team selbst, und sie sind erheblich. Getestet wurden kleine offene Modelle mit höchstens vier Milliarden Parametern, keines der großen Systeme, die Organisationen einkaufen. Statistisch abgesichert ist der Effekt nur beim Hauptmodell. Bei drei weiteren Modellen aus den Familien Qwen und Llama ist er im Mittel positiv, der Abstand ist aber zu klein, um Zufall auszuschließen. Übertragen hat sich etwas nur, wenn Lehrer- und Schülermodell dasselbe Ausgangsmodell hatten; in zwei Versuchen mit einem Lehrermodell aus einer anderen Modelllinie kam nichts an.
Die Entscheidungen selbst sind konstruierte Grenzfälle zwischen zwei Wörtern, ausgewählt, weil das Ausgangsmodell dort schwankt. Gemessen wurden Fähigkeiten wie Programmieren, Naturwissenschaft und Leseverständnis. Werte, Haltungen oder Urteile über Menschen hat die Studie nicht untersucht. Das Team beschreibt sein Verfahren als erste Erkundung.
Was das für die Aqida-Schicht heißt
Im Juli habe ich beschrieben, dass große Sprachmodelle eine Bekenntnisebene bekommen, die ihre Anbieter einbauen und nicht deklarieren: die Aqida-Schicht. Im September habe ich Studien angeführt, nach denen Nachtraining den offenen Rassismus eines Modells beseitigt und den verdeckten bestehen lässt (Sie verstehen KI. Sie verstehen nicht Verstand.).
Die neue Arbeit zeigt, dass ein Nachtraining über sein Fach hinausreicht und Entscheidungen verschiebt, die niemand mit ihm in Verbindung bringt. Eine Studie in Nature vom April 2026 hatte bereits gezeigt, dass Eigenschaften eines Modells, bis hin zu breit fehlgeleitetem Verhalten, über reine Zahlenfolgen an ein anderes Modell mit derselben Grundlage weitergegeben werden können, auch wenn jeder Hinweis darauf aus den Daten entfernt ist (Nature). Nun kommt eine Fähigkeit hinzu, übertragen über einzelne Wörter.
Ich lese das so, und es ist meine Lesart: Was ein Anbieter einem Modell im Nachtraining mitgibt, steckt im ganzen Modell. Die sichtbaren Antworten lassen sich glätten, der Abdruck sitzt tiefer und zeigt sich dort, wo gerade niemand prüft. Das meine ich mit einem eingebauten Bekenntnis, das man an der Oberfläche nicht wegtrainiert. Die vorliegende Studie belegt davon den Mechanismus für Fähigkeiten in kleinen Modellen. Ob eine Weltanschauung im Ganzen denselben Weg nimmt, hat sie nicht geprüft.
Für Organisationen halte ich ein Detail für das wichtigste: Am deutlichsten zeigte sich der Schatten dort, wo das Ausgangsmodell zwischen zwei Antworten schwankte. Im Alltag entsprechen dem die knappen Fälle, etwa zwei gleich starke Bewerbungen oder zwei vertretbare Einstufungen eines Antrags. Auf solche Entscheidungen hat die Studie ihren Befund nicht übertragen, deshalb gehören sie in jede eigene Prüfung.
Wie Organisationen Modelle für ihre eigenen Entscheidungen prüfen
- Testfälle aus dem eigenen Alltag. Legen Sie eine feste Sammlung echter, anonymisierter Fälle an, zu denen Ihre Fachleute das erwartete Ergebnis festgehalten haben. Die Bestenlisten der Anbieter messen fremde Aufgaben.
- Knappe Fälle gezielt aufnehmen. In die Sammlung gehören Fälle, bei denen zwei Entscheidungen vertretbar sind. Dort hat die Studie die Verschiebung gefunden, und dort fällt eine Änderung im Einzelfall nicht als Fehler auf.
- Ein Modellwechsel ist eine Systemänderung. Bringt der Anbieter eine neue Fassung, auch eine, die angeblich nur beim Programmieren besser geworden ist, läuft die Sammlung vor dem Einsatz erneut. Abweichungen zum letzten Lauf bewertet ein Mensch, und zu jeder Entscheidung wird festgehalten, welche Modellfassung beteiligt war.
- Deklaration statt Neutralitätsversprechen. Fragen Sie den Anbieter, welches Nachtraining zwischen zwei Fassungen stattgefunden hat und nach welchen Regeln das Modell urteilen soll. Die Zusage, das Modell sei neutral, beantwortet keine dieser Fragen. Legen Sie außerdem selbst offen, wo ein Modell an Entscheidungen über Beschäftigte, Kundinnen und Kunden oder Patientinnen und Patienten beteiligt ist.