Gen AI (Generative KI)
Kurz: Sammelbegriff für KI-Systeme, die neue Inhalte erzeugen (Text, Bilder, Code, Audio) statt nur bestehende Daten zu klassifizieren oder vorherzusagen — z. B. Sprachmodelle wie Claude oder Bildgeneratoren.
Genauer: Generative KI lernt aus riesigen Datenmengen statistische Muster und erzeugt daraus neue, plausible Inhalte — ein Sprachmodell “generiert” Text Wort für Wort basierend auf Wahrscheinlichkeiten, ein Bildmodell erzeugt Pixel aus einer Beschreibung. Abzugrenzen von klassischer/“diskriminativer” KI, die z. B. nur Kategorien vorhersagt (Spam ja/nein), aber nichts Neues erschafft.
Im Detail
Große Sprachmodelle (LLMs, “Large Language Models”) wie GPT oder Claude sind das bekannteste Beispiel für Gen AI: trainiert auf riesigen Textmengen, sagen sie bei der Generierung jeweils das wahrscheinlichste nächste “Token” (Wortteil) voraus und hängen es an den bisherigen Text an — wiederholt man das tausendfach, entsteht ein zusammenhängender Text. Bildgeneratoren (Diffusion-Modelle wie Stable Diffusion oder Midjourney) starten dagegen meist von zufälligem Bildrauschen und entfernen es schrittweise in Richtung eines Bilds, das zur Texteingabe passt.
Diese Technik bringt eigene Fallstricke mit: “Halluzinationen” — das Modell erzeugt selbstbewusst klingende, aber sachlich falsche Aussagen, weil es Plausibilität optimiert, nicht Wahrheit. Ausgaben sind zudem nicht deterministisch (dieselbe Eingabe kann leicht unterschiedliche Ergebnisse liefern) und die Trainingsdaten prägen erlernte Muster und Verzerrungen im Modell.
In der Softwareentwicklung wird Gen AI zunehmend über APIs direkt in Anwendungen eingebunden (z. B. Chat-Assistenten, automatisierte Textzusammenfassung, Code-Vervollständigung) statt nur interaktiv über eine Chat-Oberfläche genutzt.
Prompt Engineering und Kontext
Die Qualität generierter Ausgaben hängt stark von der Formulierung der Eingabe ab (“Prompt Engineering”) — präzise, gut strukturierte Anweisungen mit klarem Kontext und ggf. Beispielen liefern deutlich bessere Ergebnisse als vage Anfragen. Moderne Sprachmodelle haben zudem ein begrenztes “Kontextfenster” (die maximale Textmenge, die ein Modell gleichzeitig “im Blick” behalten kann) — Informationen außerhalb dieses Fensters stehen dem Modell schlicht nicht zur Verfügung, was bei sehr langen Unterhaltungen oder Dokumenten zu spürbaren Einschränkungen führen kann.
Fine-Tuning und RAG
Um ein generisches Modell an spezifisches Fachwissen anzupassen, gibt es im Wesentlichen zwei Ansätze: Fine-Tuning (das Modell wird zusätzlich auf domänenspezifischen Daten weitertrainiert, was die Modellgewichte selbst verändert) und RAG (“Retrieval-Augmented Generation”, bei dem relevante Informationen zur Laufzeit aus einer externen Wissensquelle abgerufen und dem Prompt hinzugefügt werden, ohne das Modell selbst zu verändern). RAG gilt oft als flexibler und günstiger, da sich die Wissensbasis jederzeit aktualisieren lässt, ohne ein komplettes Neu-Training durchzuführen.