📈SEO

Fine-Tuning — Modelle nachtrainieren

Fine-Tuning klingt nach der Königsdisziplin, ist aber seltener die richtige Antwort als gedacht. Wann sich Nachtrainieren lohnt und wann Prompting oder RAG gewinnen.

FDT
FJ Design Team
KI & Automatisierung
16. Juli 20268 Min.

"Dann trainieren wir das Modell eben auf unsere Daten"

Es ist ein Satz, der in fast jedem KI-Projektgespräch irgendwann fällt. Ein Großhändler ist unzufrieden damit, dass der neue KI-Assistent Fragen zum eigenen Sortiment nur vage beantwortet, und der Geschäftsführer schlägt die scheinbar naheliegende Lösung vor: "Dann trainieren wir das Modell eben mit unseren Katalogen und Preislisten nach, dann kennt es unser Sortiment." Der Gedanke ist verständlich, denn er überträgt eine vertraute Vorstellung vom Lernen auf die Maschine: Wer mehr liest, weiß mehr. Nur führt er in diesem Fall in die Irre, und zwar auf teure Weise. Für aktuelles Faktenwissen ist Fine-Tuning das falsche Werkzeug, während es für andere Probleme, an die zunächst niemand dachte, glänzend funktioniert. Um diese Unterscheidung geht es in diesem Beitrag.

Zunächst zur Begriffsklärung: Fine-Tuning bedeutet, ein bereits fertig trainiertes Sprachmodell mit eigenen Beispieldaten weiterzutrainieren. Das Grundmodell hat in seinem ursprünglichen Training aus riesigen Textmengen Sprache, Weltwissen und Fähigkeiten gelernt, dieses Wissen steckt in Milliarden von Zahlenwerten, den Gewichten. Beim Fine-Tuning werden diese Gewichte anhand Ihrer Beispiele behutsam nachjustiert, typischerweise mit einigen hundert bis einigen tausend Paaren aus Eingabe und gewünschter Ausgabe. Moderne, sparsame Verfahren verändern dabei nur einen kleinen Teil der Parameter, was das Training erheblich verbilligt. Das Ergebnis ist ein Modell, das sich anders verhält: Es hat aus den Beispielen Muster übernommen, einen Stil, ein Format, eine Art zu antworten.

Warum Fine-Tuning seltener die Antwort ist als gedacht

Der Kern des Missverständnisses liegt in dem, was ein Modell beim Nachtraining tatsächlich lernt. Es lernt vor allem Verhalten, nicht zuverlässig abrufbares Wissen. Wer ein Modell mit tausend Produktdatenblättern nachtrainiert, erhält kein verlässliches Nachschlagewerk, sondern ein Modell, das so klingt wie Produktdatenblätter, einzelne Fakten daraus vielleicht wiedergibt, andere vermischt oder schlicht erfindet. Für Faktenauskünfte ist das fatal, denn falsche Preise oder Lieferzeiten mit selbstbewusstem Ton sind schlimmer als eine ehrliche Wissenslücke.

Dazu kommen praktische Nachteile. Ein nachtrainiertes Modell ist ein Standbild: Ändert sich das Sortiment, muss neu trainiert werden, während eine angebundene Datenbank sich einfach aktualisieren lässt. Fine-Tuning kostet Zeit und Geld, nicht nur einmalig für Datenaufbereitung und Training, sondern dauerhaft, denn jede neue Version des Basismodells wirft die Frage auf, ob das Nachtraining wiederholt werden muss. Es macht Experimente träge, weil jede Anpassung einen Trainingslauf statt einer Promptänderung erfordert. Und es birgt das Risiko, dass das Modell durch einseitige Trainingsdaten allgemeine Fähigkeiten einbüßt, ein Effekt, der sich schleichend zeigt und ohne systematische Messung leicht übersehen wird. Die erfahrene Faustregel lautet darum: Fine-Tuning ist die letzte Stufe der Eskalation, nicht die erste Idee.

#

Die günstigeren Alternativen: Prompting, Few-Shot und RAG

Bevor über Training gesprochen wird, sollten drei einfachere Hebel ausgereizt sein. Der erste ist sorgfältiges Prompting: Erstaunlich viele "Das Modell kann das nicht"-Probleme verschwinden, wenn die Anweisung präzise beschreibt, was gewünscht ist, mit klaren Regeln, definiertem Format und explizit benannten Grenzfällen. Der zweite Hebel ist Few-Shot-Prompting, also das Mitgeben von zwei bis fünf guten Beispielen direkt im Prompt. Sprachmodelle sind exzellente Musterimitatoren: Wer drei vorbildliche Antwort-Beispiele zeigt, bekommt in vielen Fällen genau den Stil und das Format, das man sonst antrainieren wollte, ohne einen einzigen Trainingslauf und jederzeit änderbar.

Der dritte Hebel ist RAG, Retrieval-Augmented Generation. Dabei bleibt das Modell unverändert, aber es bekommt zur Laufzeit die relevanten Wissensbausteine mitgeliefert: Die Nutzerfrage wird gegen eine durchsuchbare Ablage Ihrer Dokumente geprüft, die passendsten Abschnitte werden gefunden und dem Modell zusammen mit der Frage in den Prompt gelegt, worauf es seine Antwort auf genau diese Quellen stützt. Für den Großhändler aus dem Eingangsbeispiel ist das die richtige Architektur: Das Sortiment liegt in einer aktualisierbaren Wissensbasis, Preisänderungen sind sofort wirksam, und die Antworten lassen sich mit Quellenangabe belegen. Als Merksatz hat sich bewährt: Geht es um Wissen, besonders um veränderliches Wissen, nehmen Sie RAG. Geht es um Verhalten, Stil und Form, kommt Fine-Tuning in Frage. Beides schließt sich übrigens nicht aus, es adressiert schlicht verschiedene Probleme.

Wo Fine-Tuning wirklich glänzt

Es gibt Aufgaben, bei denen Nachtrainieren seine Stärken voll ausspielt. Die erste Kategorie ist konsistenter Stil und striktes Format in großem Volumen. Wenn zehntausende Produktbeschreibungen exakt der Haus-Tonalität folgen sollen, wenn ein System zuverlässig ein spezielles strukturiertes Ausgabeformat einhalten muss oder wenn Antworten immer demselben Aufbau folgen sollen, dann kann ein Modell, das diese Muster verinnerlicht hat, besser und stabiler sein als jedes noch so ausgefeilte Prompt, und nebenbei schrumpfen die Prompts, weil die vielen Beispiele und Regeln entfallen, was bei hohem Volumen bares Geld spart.

Die zweite Kategorie sind Spezialdomänen mit eigener Sprache. Juristische Schriftsätze, medizinische Befunde, Versicherungsgutachten oder die Terminologie eines engen technischen Fachgebiets folgen Konventionen, die ein Generalistenmodell nur oberflächlich beherrscht. Mit einigen hundert bis tausend hochwertigen Beispielen lässt sich ein Modell auf diesen Zungenschlag einstimmen. Eine dritte, oft übersehene Kategorie ist das Aufwerten kleiner Modelle: Ein kompaktes, lokal oder günstig betreibbares Modell wird per Fine-Tuning auf eine einzige, eng umrissene Aufgabe spezialisiert, etwa das Klassifizieren von Eingangspost, und erreicht dort die Qualität eines viel größeren Modells, bei einem Bruchteil der laufenden Kosten. Gemeinsam ist allen drei Fällen: Es geht um wiederkehrendes, stabiles Verhalten, nicht um tagesaktuelles Wissen. Ein brauchbarer Selbsttest vor der Entscheidung lautet: Könnten Sie die gewünschte Verbesserung einem neuen Mitarbeiter durch das Vorlegen von hundert guten Beispielen beibringen, ohne ihm ein einziges neues Faktum zu nennen? Wenn ja, ist Fine-Tuning ein Kandidat. Wenn die Antwort dagegen von Informationen abhängt, die sich ändern oder die nachgeschlagen werden müssen, sind Sie im Territorium von RAG.

Datensatz-Qualität schlägt Menge

Steht die Entscheidung für Fine-Tuning, wird der Datensatz zum wichtigsten Erfolgsfaktor, wichtiger als das gewählte Verfahren und meist wichtiger als die schiere Menge. Einige hundert exzellente, konsistente Beispiele schlagen zehntausend mittelmäßige, denn das Modell lernt gnadenlos alles, was in den Daten steckt, auch die Fehler, die Widersprüche und die schlechten Angewohnheiten. Wenn dieselbe Art von Anfrage in Ihren Trainingsdaten mal förmlich und mal salopp, mal mit und mal ohne Anrede beantwortet wird, lernt das Modell genau diese Beliebigkeit.

Woher kommen gute Beispiele? Die beste Quelle sind reale Fälle, die Ihre besten Fachkräfte bereits vorbildlich gelöst haben: die überzeugendsten Angebotstexte, die saubersten Befundzusammenfassungen, die Antworten des erfahrensten Mitarbeiters im Kundenservice. Wo solche Vorbilder fehlen, lassen sich Beispiele auch mit einem starken Modell vorentwerfen und anschließend von Fachleuten korrigieren, das ist meist schneller, als alles von Hand zu schreiben, ersetzt die menschliche Endkontrolle aber nicht. Denn ungeprüft übernommene Maschinenbeispiele trainieren dem Modell im Zweifel genau die Fehler an, die man loswerden wollte.

In der Praxis heißt das: Beispiele kuratieren statt sammeln. Jedes Trainingspaar sollte eine Eingabe zeigen, wie sie im Betrieb wirklich vorkommt, und eine Ausgabe, die Sie vorbehaltlos als Goldstandard unterschreiben würden, im richtigen Ton, im richtigen Format, fachlich korrekt. Duplikate und Fast-Duplikate gehören entfernt, weil sie das Modell einseitig auf wenige Muster fixieren. Die Bandbreite der echten Fälle sollte abgedeckt sein, auch die unbequemen, etwa Anfragen, die abgelehnt oder an Menschen eskaliert werden müssen, denn auch Ablehnen will gelernt sein. Und ein Teil der Beispiele wird konsequent zurückgehalten und nie mittrainiert: Er dient später als unabhängiger Prüfstein, ob das Modell gelernt hat zu verallgemeinern oder nur auswendig aufsagt.

Realistischer Ablauf und ehrliche Kosten

Ein typisches Fine-Tuning-Projekt läuft in fünf Etappen. Am Anfang steht die Baseline: Man misst mit einem Satz repräsentativer Testfälle, wie gut das Basismodell mit sorgfältigem Prompting bereits ist, denn ohne diesen Vergleichswert lässt sich ein Trainingserfolg gar nicht nachweisen, und nicht selten endet das Projekt ehrlicherweise hier, weil die Baseline schon genügt. Es folgt die Datenarbeit, erfahrungsgemäß der größte Posten: Beispiele sammeln, vereinheitlichen, bereinigen, kuratieren, dahinter stecken je nach Ausgangslage Tage bis Wochen Fachkräftezeit. Der eigentliche Trainingslauf ist dagegen fast unspektakulär: Bei Cloud-Anbietern lädt man den aufbereiteten Datensatz hoch und erhält je nach Umfang nach Minuten bis Stunden ein angepasstes Modell, die reinen Rechenkosten liegen für mittelstandstypische Datensätze oft nur im zwei- bis dreistelligen Eurobereich. Alternativ trainiert man offene Modelle mit sparsamen Verfahren auf gemieteter oder eigener GPU-Hardware, was mehr Know-how erfordert, aber volle Kontrolle gibt.

Danach kommt die Auswertung gegen die zurückgehaltenen Testfälle und im direkten Vergleich zur Baseline: besser, gleich oder schlechter, und zwar messbar, nicht gefühlt. Und schließlich der Betrieb, der eigentliche Dauerposten: Das Modell muss bereitgestellt, überwacht und bei neuen Basismodell-Versionen oder verändertem Bedarf neu trainiert werden. Die Gesamtrechnung wird also von Menschen- und Pflegezeit dominiert, nicht von GPU-Stunden, und genau deshalb lohnt Fine-Tuning erst, wenn der Nutzen dauerhaft und das Einsatzvolumen nennenswert ist.

Fazit: das richtige Werkzeug am richtigen Ort

Fine-Tuning ist weder Zauberstab noch Pflichtprogramm, sondern ein Spezialwerkzeug für konsistentes Verhalten: Stil, Format und Domänensprache in Serie. Für Wissen, zumal veränderliches, führt der Weg über RAG, und erstaunlich viele Anforderungen erledigt schon präzises Prompting mit guten Beispielen. Drei nächste Schritte: Formulieren Sie für Ihren Anwendungsfall schriftlich, ob das Problem im Wissen oder im Verhalten des Modells liegt, dieser eine Satz entscheidet über den Werkzeugkasten. Reizen Sie Prompting und Few-Shot-Beispiele aus und messen Sie das Ergebnis mit einem kleinen Testset, bevor Sie über Training sprechen. Und falls Fine-Tuning tatsächlich ansteht, beginnen Sie mit fünfzig handverlesenen Goldstandard-Beispielen statt mit einem ungeprüften Datenexport. Wenn Sie bei dieser Abwägung Unterstützung möchten: FJ Design begleitet mittelständische Unternehmen von der Werkzeugwahl bis zur produktiven KI-Lösung.

Fine-TuningRAGPromptingTrainingsdatenLLMModellanpassung
Teilen:

Fragen zu diesem Thema?

Lassen Sie uns gemeinsam besprechen, wie wir diese Strategien für Ihr Unternehmen umsetzen können.

Kostenlos beraten lassen