Tutorial-Reihe

RAG verstehen - Schritt für Schritt mit echten Daten

Wir bauen ein Retrieval-Augmented-Generation-System von Null auf. Mit echten Embeddings, einer echten Vektor-Datenbank und Demos, die du jederzeit anhalten und auseinandernehmen kannst.

8 Kapitel · 81 Minuten Lesezeit · 5 Labs

Ein Sprachmodell weiß nur, was zum Zeitpunkt seines Trainings in den Daten stand. Über deine Handbücher, eure Tickets oder das Protokoll von letzter Woche weiß es nichts. Fragst du trotzdem, bekommst du keine Fehlermeldung, sondern eine plausibel klingende Erfindung - und genau das macht diese Lücke gefährlich.

Retrieval-Augmented Generation dreht deshalb die Reihenfolge um: erst suchen, dann antworten. Zu jeder Frage werden die passenden Stellen aus deinem eigenen Bestand herausgesucht und dem Modell als Kontext mitgegeben. Das Modell formuliert dann nur noch aus dem, was vor ihm liegt. Das klingt einfach. Die Arbeit steckt in den Schritten dazwischen.

Was wir hier bauen

Wir bauen ein RAG-System von null auf, Schritt für Schritt und jeden Schritt für sich nachvollziehbar: wie aus Text Zahlen werden, die Bedeutung tragen; warum ein Dokument in Stücke zerlegt werden muss und was ein schlechter Schnitt kostet; wie eine Vektor-Datenbank in Millisekunden die nächsten Nachbarn findet

  • wir nehmen pgvector in Postgres, weil Postgres in den meisten Projekten ohnehin schon steht; und wie aus einer Trefferliste eine Antwort wird, die sich belegen lässt.

Der zweite Teil des Kurses ist der unbequemere. Ein RAG-System, das in der Demo läuft, scheitert im Alltag selten am Modell. Es scheitert an falsch gesetzten Chunk-Grenzen, an Fragen, auf die der Bestand gar keine Antwort hält, und an Treffern, die zwar ähnlich, aber nicht relevant sind. Diese Fehlerbilder sehen wir uns einzeln an - und messen sie, statt sie zu erahnen.

Wie du damit arbeitest

Zu fast jedem Kapitel gehört ein Lab, das im Browser läuft: ein naïves RAG zum Anfassen, ein Embedding-Explorer, eine Chunking-Werkstatt, ein Vergleich verschiedener Retrieval-Verfahren und ein Lab, in dem du Fehler gezielt erzeugst. Du kannst jede Demo anhalten, Parameter verstellen und zusehen, was sich ändert. Das ist der eigentliche Punkt: RAG ist kein Rezept, sondern eine Kette von Entscheidungen mit sichtbaren Folgen.

Vorausgesetzt wird, dass dir ein LLM-Aufruf nicht fremd ist und du weißt, was ein Prompt ist. Programmierkenntnisse helfen beim Übertragen auf dein eigenes Projekt, für die Labs brauchst du sie nicht - die laufen ohne Installation. Wer den Kurs zu Ende geht, kann ein RAG-System nicht nur beschreiben, sondern die Stelle benennen, an der es im eigenen Fall schiefgeht.

Kapitel

  1. 01
    Die Grenze
    8 minLab: Naïves RAG
  2. 02
    Kontext injizieren
    10 minLab: Naïves RAG
  3. 03
    Bedeutung als Vektor
    14 minLab: Embedding-Explorer
  4. 04
    Chunking
    10 minLab: Chunking-Werkstatt
  5. 05
    Vektor-Datenbank
    8 min
  6. 06
    Retrieval
    14 minLab: Retrieval-Vergleich
  7. 07
    Alltag, Failures, Evaluation
    12 minLab: Failures & Evaluation
  8. 08
    Ausblick
    5 min