Die Frage „RAG oder Fine-Tuning?“ wird in den meisten Projekten zu früh gestellt. Sie klingt wie eine Technologieentscheidung, ist aber eine Diagnosefrage: Warum liefert das System heute keine brauchbaren Antworten? Erst wenn die Fehlerursache benannt ist, lässt sich beurteilen, welche Technik sie behebt und welche nur teuer ist.
Zwei Techniken, zwei verschiedene Hebel
Retrieval-Augmented Generation stellt einem Modell zur Laufzeit die passenden freigegebenen Informationen bereit. Es verändert, was das Modell in diesem Moment weiß. Fine-Tuning verändert dagegen anhand von Beispielen, wie sich das Modell verhält: Format, Tonalität, Klassifikationsregeln, Umgang mit bestimmten Eingaben. Neues Faktenwissen lässt sich damit nicht zuverlässig einbringen, und jede Änderung an den Quellen würde ein erneutes Training verlangen.
Diagnose vor Architektur: Symptom, Ursache, Maßnahme
| Beobachtetes Symptom | Wahrscheinliche Ursache | Passende Maßnahme |
|---|---|---|
| Antworten sind veraltet oder erfinden Details | Wissen fehlt | Retrieval mit gepflegten, freigegebenen Quellen |
| Antworten sind inhaltlich richtig, aber im falschen Format oder Ton | Verhalten uneinheitlich | Präzisere Anweisungen und Beispiele, erst danach Fine-Tuning |
| Antworten sind korrekt, Nutzer empfinden sie trotzdem als nutzlos | Aufgabe unklar definiert | Prozess und Zielergebnis klären, nicht das Modell wechseln |
| Fachbegriffe werden falsch verstanden | Domänensprache fehlt | Glossar im Kontext bereitstellen; Fine-Tuning nur bei stabiler Sprache und ausreichend Beispielen |
| Lange Dokumente werden unvollständig ausgewertet | Kontextaufbereitung schwach | Aufteilung, Metadaten und Neubewertung der Treffer verbessern |
| Dasselbe Problem tritt bei jedem Modell auf | Datenqualität | Quellen bereinigen, Dubletten und Widersprüche entfernen |
Die Tabelle zeigt, dass in vier von sechs Fällen weder Fine-Tuning noch ein größeres Modell die Antwort ist. Meist liegt die Ursache in den Quellen oder in der Aufgabenbeschreibung.
Was Retrieval im Betrieb wirklich kostet
RAG gilt als der einfache Weg, ist aber kein Selbstläufer. Quellen müssen ausgewählt, bereinigt und mit Berechtigungen versehen werden. Der Index muss aktualisiert werden, wenn sich Dokumente ändern. Die Trefferqualität muss gemessen werden, weil ein Modell aus falschen Passagen eine flüssige, aber falsche Antwort erzeugt. Wer diese Pflegeaufgaben nicht einplant, bekommt nach einigen Monaten ein System, das veraltete Dokumente überzeugend zusammenfasst.
Wann Fine-Tuning trotzdem die richtige Wahl ist
- Die Aufgabe ist stabil und eng umrissen, etwa eine Klassifikation oder eine feste Ausgabestruktur.
- Es existieren viele geprüfte Beispiele, an denen das Modell nutzen darf und deren Rechte geklärt sind.
- Latenz oder Kosten sprechen für ein kleineres, spezialisiertes Modell statt eines großen Allzweckmodells.
- Es gibt ein Testset, mit dem jede neue Modellversion vor dem Einsatz verglichen wird.
Fehlt eine dieser Voraussetzungen, ist Fine-Tuning meist eine teure Abkürzung für ein Problem, das durch bessere Anweisungen oder bessere Quellen lösbar wäre.
Ein Proof of Concept mit zwei getrennten Messgrößen
Ein aussagekräftiger Test misst zwei Dinge unabhängig voneinander. Erstens die Retrieval-Qualität: Findet das System zu einer Frage die richtigen Passagen? Dafür genügen einige Dutzend Fragen mit bekannten Quellstellen. Zweitens die Antwortqualität: Erzeugt das Modell aus den richtigen Passagen ein brauchbares Ergebnis? Wer beide Werte vermischt, weiß am Ende nicht, ob die Quellen, die Suche oder das Modell verbessert werden müssen. Wie ein solches Testset aufgebaut wird, beschreibt der Beitrag zur systematischen Evaluation.
Wenn ein erfahrener Mitarbeiter mit denselben Unterlagen die Frage nicht beantworten könnte, wird es auch kein Modell tun. Fehlende oder widersprüchliche Quellen sind ein Redaktionsproblem, kein Architekturproblem.
Die Entscheidung festhalten
Am Ende sollte ein kurzes Dokument stehen: Welches Symptom wurde beobachtet, welche Ursache wurde belegt, welche Technik wurde gewählt und welche Messwerte müssen erhalten bleiben. Diese Aufzeichnung schützt vor der nächsten Diskussion, sobald ein neues Modell erscheint. Die Frage, welches Modell überhaupt in Betracht kommt, behandelt der Beitrag zur Modellwahl.