Die Frage „RAG oder Fine-Tuning?“ wird in den meisten Projekten zu früh gestellt. Sie klingt wie eine Technologieentscheidung, ist aber eine Diagnosefrage: Warum liefert das System heute keine brauchbaren Antworten? Erst wenn die Fehlerursache benannt ist, lässt sich beurteilen, welche Technik sie behebt und welche nur teuer ist.

Zwei Techniken, zwei verschiedene Hebel

Retrieval-Augmented Generation stellt einem Modell zur Laufzeit die passenden freigegebenen Informationen bereit. Es verändert, was das Modell in diesem Moment weiß. Fine-Tuning verändert dagegen anhand von Beispielen, wie sich das Modell verhält: Format, Tonalität, Klassifikationsregeln, Umgang mit bestimmten Eingaben. Neues Faktenwissen lässt sich damit nicht zuverlässig einbringen, und jede Änderung an den Quellen würde ein erneutes Training verlangen.

Diagnose vor Architektur: Symptom, Ursache, Maßnahme

Beobachtetes SymptomWahrscheinliche UrsachePassende Maßnahme
Antworten sind veraltet oder erfinden DetailsWissen fehltRetrieval mit gepflegten, freigegebenen Quellen
Antworten sind inhaltlich richtig, aber im falschen Format oder TonVerhalten uneinheitlichPräzisere Anweisungen und Beispiele, erst danach Fine-Tuning
Antworten sind korrekt, Nutzer empfinden sie trotzdem als nutzlosAufgabe unklar definiertProzess und Zielergebnis klären, nicht das Modell wechseln
Fachbegriffe werden falsch verstandenDomänensprache fehltGlossar im Kontext bereitstellen; Fine-Tuning nur bei stabiler Sprache und ausreichend Beispielen
Lange Dokumente werden unvollständig ausgewertetKontextaufbereitung schwachAufteilung, Metadaten und Neubewertung der Treffer verbessern
Dasselbe Problem tritt bei jedem Modell aufDatenqualitätQuellen bereinigen, Dubletten und Widersprüche entfernen

Die Tabelle zeigt, dass in vier von sechs Fällen weder Fine-Tuning noch ein größeres Modell die Antwort ist. Meist liegt die Ursache in den Quellen oder in der Aufgabenbeschreibung.

Was Retrieval im Betrieb wirklich kostet

RAG gilt als der einfache Weg, ist aber kein Selbstläufer. Quellen müssen ausgewählt, bereinigt und mit Berechtigungen versehen werden. Der Index muss aktualisiert werden, wenn sich Dokumente ändern. Die Trefferqualität muss gemessen werden, weil ein Modell aus falschen Passagen eine flüssige, aber falsche Antwort erzeugt. Wer diese Pflegeaufgaben nicht einplant, bekommt nach einigen Monaten ein System, das veraltete Dokumente überzeugend zusammenfasst.

Wann Fine-Tuning trotzdem die richtige Wahl ist

  • Die Aufgabe ist stabil und eng umrissen, etwa eine Klassifikation oder eine feste Ausgabestruktur.
  • Es existieren viele geprüfte Beispiele, an denen das Modell nutzen darf und deren Rechte geklärt sind.
  • Latenz oder Kosten sprechen für ein kleineres, spezialisiertes Modell statt eines großen Allzweckmodells.
  • Es gibt ein Testset, mit dem jede neue Modellversion vor dem Einsatz verglichen wird.

Fehlt eine dieser Voraussetzungen, ist Fine-Tuning meist eine teure Abkürzung für ein Problem, das durch bessere Anweisungen oder bessere Quellen lösbar wäre.

Ein Proof of Concept mit zwei getrennten Messgrößen

Ein aussagekräftiger Test misst zwei Dinge unabhängig voneinander. Erstens die Retrieval-Qualität: Findet das System zu einer Frage die richtigen Passagen? Dafür genügen einige Dutzend Fragen mit bekannten Quellstellen. Zweitens die Antwortqualität: Erzeugt das Modell aus den richtigen Passagen ein brauchbares Ergebnis? Wer beide Werte vermischt, weiß am Ende nicht, ob die Quellen, die Suche oder das Modell verbessert werden müssen. Wie ein solches Testset aufgebaut wird, beschreibt der Beitrag zur systematischen Evaluation.

Faustregel aus dem Betrieb

Wenn ein erfahrener Mitarbeiter mit denselben Unterlagen die Frage nicht beantworten könnte, wird es auch kein Modell tun. Fehlende oder widersprüchliche Quellen sind ein Redaktionsproblem, kein Architekturproblem.

Die Entscheidung festhalten

Am Ende sollte ein kurzes Dokument stehen: Welches Symptom wurde beobachtet, welche Ursache wurde belegt, welche Technik wurde gewählt und welche Messwerte müssen erhalten bleiben. Diese Aufzeichnung schützt vor der nächsten Diskussion, sobald ein neues Modell erscheint. Die Frage, welches Modell überhaupt in Betracht kommt, behandelt der Beitrag zur Modellwahl.

Älterer BeitragPersonenbezogene Daten in KI-Systemen: Zweck vor DatenmengeNeuerer BeitragKI-generierte Inhalte kennzeichnen: Was 2026 vorbereitet sein sollte