Chatbots & Assistenten
Der bekannteste Anwendungsfall. LLMs beantworten Fragen, führen Dialoge und erinnern sich an den Kontext eines Gesprächs.
LLMs verstehen
Lernseite von Zweitkopf
Diese Überschrift hätte auch anders enden können, mit ChatGPT, Claude oder Gemini. Ein Sprachmodell wählt jedes Wort aus Kandidaten mit Wahrscheinlichkeiten, eins nach dem anderen. Wie das geht, zeigen die Bilder darunter, jedes mit einem Satz; wer mehr will, klappt unter jedem Bild die Station auf. Die Prozente oben sind zur Anschauung gesetzt, keine Messung.
Teil 1 von 3, Grundidee
Ein Sprachmodell tut genau eine Sache: Es sagt das nächste Wort voraus. Vier Bilder zeigen, was daraus folgt.
Bilder 1 bis 4: Wort für Wort, Die Stücke, Die Wahl, Der Regler
Dein Handy schlägt dir das nächste Wort vor, und ein Sprachmodell wie ChatGPT macht genau das, nur für ganze Antworten.
Die einfachste Antwort: eine Autovervollständigung auf Steroiden. Drei Vergleiche zeigen, was das heißt.
„LLM“ steht für Large Language Model, ein großes Sprachmodell. Bekannte Beispiele sind ChatGPT (von OpenAI), Claude (von Anthropic) und Gemini (von Google). Sie alle funktionieren nach demselben Grundprinzip: Sie sagen voraus, welches Wort als nächstes kommt, immer wieder, bis eine vollständige Antwort steht.
In drei Schritten: Text wird zerlegt, in Bedeutung übersetzt, und Stück für Stück vorhergesagt.
Der Text wird in kleine Bausteine, sogenannte Tokens, zerteilt. Ein Token kann ein ganzes Wort sein, oft aber auch nur ein Wortteil. Auch Leerzeichen und Satzzeichen sind Teile dieser Bausteine.
Jeder Token wird in eine lange Zahlenliste (Vektor) verwandelt. Diese Zahlen kodieren die Bedeutung im Kontext, ähnliche Wörter liegen im Zahlenraum nah beieinander.
Das Modell berechnet für jedes mögliche nächste Token eine Wahrscheinlichkeit. Das wahrscheinlichste (oder ein zufällig gezogenes) wird angehängt und der Vorgang startet von vorn.
Ein Sprachmodell liest keine Wörter, sondern Stücke, sogenannte Tokens, und schon die Überschrift oben zerfällt in mehr Stücke als Wörter.
128.256Stücke kennt Llama 3
Quelle: tiktoken und Llama 3
Dort wartet der Zerleger, in den du deinen eigenen Satz tippst.
Ein Sprachmodell liest keine Wörter, es zählt Stücke. Tipp deinen eigenen Satz ein und zähl die Stücke.
Demo 1 von 11
Hinweis: Echte LLMs nutzen sogenannte BPE-Tokenizer(Byte Pair Encoding). Sie lernen aus Daten, welche Subwort-Stücke häufig vorkommen. Diese Demo nutzt eine vereinfachte Heuristik für deutsche Suffixe und lange Wörter, das Prinzip ist aber das gleiche: Text wird in Stücke zerlegt.
Die Überschrift oben war eine Wahl: Jeder Kandidat bekam eine Zahl, einer gewann, und die Zahl verschwindet, sobald das Wort steht.
Dort wartet die Kandidatenliste, aus der du das nächste Wort selbst wählst.
Das Modell berechnet für jedes mögliche nächste Wort eine Wahrscheinlichkeit und wählt eines. Wähl das zweite Wort statt des ersten und lies, was daraus wird.
Demo 2 von 11
Zahlen didaktisch, Prinzip echt: Ein LLM berechnet bei jedem Schritt Wahrscheinlichkeiten für jedes Token seines Wortschatzes. Der umfasst je nach Modell rund 50.000 bis 200.000 Einträge. Wir zeigen hier nur die Spitze dieser Liste. Mit Temperature, Top-k und Top-p kann man die Auswahl beeinflussen, mal sehr konservativ (immer das wahrscheinlichste), mal kreativer.
Was dieses Raten für Zahlen, Verträge und Angebote bedeutet, steht in Station 6: Grenzen.
Dass dasselbe Modell auf dieselbe Frage zweimal anders antwortet, liegt an einem Regler, der Temperatur, und im Chatfenster siehst du ihn nicht.
Dort wartet der Regler, den du von null bis zwei drehst.
Wenn dasselbe Modell auf dieselbe Frage verschiedene Antworten gibt, liegt das selten an Unsicherheit. Es liegt an einem einzigen Wert. Zieh den Regler auf 0,0 und dann auf 2,0.
Demo 3 von 11
Standardbereich für Chatbots. Natürlich, lebendig, kontrolliert.
Je näher der Regler an 0 steht, desto sicherer gewinnt das wahrscheinlichste Wort. Je weiter er aufdreht, desto gleicher werden die Chancen aller Wörter. Bei T = 1,0 stehen hier dieselben drei Spitzenwerte wie in der Wort-Vorhersage weiter oben, sie stammen aus derselben Datei. Die acht Kandidaten und ihre Ausgangswerte sind Lernbeispiele, keine Modellausgabe.
Der Koch hält sich strikt an das Rezept, jedes Mal exakt dieselbe Carbonara.
Präzise, vorhersehbar. Ideal für Faktenabfragen, Code-Generierung, JSON-Outputs.
Der Koch variiert hier und da Mengen oder fügt mal Pfeffer extra hinzu.
Standardbereich für Chatbots. Natürliche, lebendige Sprache mit kontrollierter Variation.
Der Koch improvisiert wild, Carbonara mit Trüffeln oder Schokolade. Manchmal genial, manchmal ungenießbar.
Brainstorming, kreatives Schreiben. Risiko: inkohärenter Output, wenn zu hoch.
Klingt vernünftig, ist es aber nur selten. Bei T = 0 wählt das Modell immer die „sicherste“ Antwort, was bei kreativen oder offenen Aufgaben schlechtere Ergebnisse liefert als kontrollierte Variation.
Studien zeigen: Bei manchen Problemen liefern mehrere Samples mit moderater Temperature (und anschließender Auswahl der besten Antwort) bessere Resultate als ein einzelner deterministischer Versuch, Stichwort Self-Consistency.
Teil 2 von 3, Im Alltag
Was das Raten für dich bedeutet: wo es danebenliegt und wie du es lenkst.
Bilder 5 bis 8: Raten statt wissen, Das Fenster, Das Lenkrad, Die vier Augen
Das Modell rät und weiß nichts, deshalb klingt es auch im Irrtum sicher: Entwürfe ja, aber Zahlen, Verträge und Quellen nur geprüft.
LLMs können viel, aber sie wissen nichts. Sie raten plausibel. Wenn die plausibelste Antwort falsch ist, klingt sie trotzdem überzeugend.
LLMs erfinden Fakten, Quellen oder Zitate, die überzeugend klingen, aber falsch sind. Besonders bei Spezialwissen oder seltenen Themen.
Das Modell kennt nur, was bis zum Training-Cutoff im Internet stand. Aktuelle Ereignisse, neue Studien, jüngste Releases? Lücke.
LLMs sind keine Rechner. Sie raten plausibel, das geht bei einfacher Mathematik oft schief, besonders bei mehrstelligen Multiplikationen.
Trainingsdaten enthalten gesellschaftliche Vorurteile, das Modell reproduziert sie. Stereotype zu Gender, Ethnizität, Berufen können auftauchen.
Ein LLM versteht nichts, es erkennt Muster. Es kann erstaunlich klug klingen und gleichzeitig grundlegende Logik-Aufgaben verfehlen.
Das größte Risiko: LLMs klingen souverän, selbst wenn sie raten. Es gibt selten ein "Ich weiß es nicht", fast immer eine Antwort.
Werkzeuge, RAG, der passende Fall: was davon Einrichtungsarbeit ist und wer sie macht, steht am Ende der Seite unter Für mein Team.
Ein Modell sieht immer nur, was gerade in seinem Fenster steht, und was da nicht hineinpasst, kennt es nicht.
1 MillionTokens passen ins Fenster
Quelle: Anthropic, Modellübersicht und Liu u. a., TACL 2023
Dort wartet die Kurve, die zeigt, wo im Fenster gefunden wird.
Ein Sprachmodell hat kein Gedächtnis. Es hat ein Fenster, und alles, was es für eine Antwort weiß, muss darin stehen.
Wenn du ChatGPT etwas fragst, bekommt das Modell nicht „die Frage“. Es bekommt einen Stapel Text: die Anweisung des Anbieters, deine Frage, alles, was du angehängt hast, und den bisherigen Verlauf des Gesprächs. Dieser Stapel heißt Kontextfenster, und er ist alles, was das Modell in diesem Moment sieht. Danach ist er weg.
Daraus folgen zwei Dinge, die im Betrieb sofort zählen. Das Modell kennt deine Unterlagen nicht, solange sie niemand ins Fenster legt. Und der Platz darin ist begrenzt, auch wenn er groß klingt.
Eine Million Tokens klingt nach viel
Das sind etwa 550.000 bis 750.000 Wörter, also ein gutes Regal voll. Nur teilen sich diesen Platz die Anweisung, deine Frage, jede angehängte Datei und jede Zeile, die ihr bisher geschrieben habt. Ein langes Gespräch über einen Vertrag füllt ihn schneller, als man denkt.
Und es ist nicht so, dass alles im Fenster gleich gut ankommt. Sieben Forscherinnen und Forscher um Nelson Liu haben 2023 gemessen, wo ein Modell die passende Stelle findet: am Anfang gut, am Ende gut, in der Mitte deutlich schlechter. Das Ergebnis wiederholte sich bei sechs verschiedenen Modellfamilien, auch bei solchen mit sehr großem Fenster.
Was das für den Betrieb heißt
Dasselbe Modell für alle, das Lenkrad ist deine Frage, und mit Rolle, Kontext und Format wird aus der Rückfrage ein Entwurf.
Dort warten das Prompt-Labor, in dem du fünf Bausteine zuschaltest und der Posteingang, aus dem du dir einen fertigen Prompt kopierst.
Dasselbe Modell liefert brauchbare oder nutzlose Antworten, oft entscheidet nur, wie du fragst. Schalte Kontext liefern ein und vergleich die zwei Antworten.
Das Modell ist fix, das Einzige, was du steuerst, ist der Prompt. Er ist dein Lenkrad. Ein präziser Prompt macht die gewünschte Antwort zur wahrscheinlichsten, ein nachlässiger überlässt alles dem Zufall.
Dieselbe Grundfrage, „Wohin soll ich reisen?“, einmal nackt und einmal angereichert. Schalte die Bausteine zu und sieh, wie die Antwort von einer Rückfrage zu einem fertigen Vorschlag wird.
Demo 4 von 11
Nur die nackte Frage, das Modell muss raten, was du wirklich willst.
Das kommt ganz darauf an. Es gibt unzählige Ziele, von Italien über Thailand bis Norwegen. Magst du eher Strand, Stadt oder Berge? Und wann, wie lange und mit welchem Budget möchtest du reisen?
Wichtig: Die Qualität hier ist simuliert, um das Prinzip zu zeigen. Aber die Richtung stimmt, jeder Baustein gibt dem Modell mehr, woran es sich festhalten kann.
Vage Fragen führen zu vagen Antworten. Sag genau, was du willst, Umfang, Ziel, Einschränkungen.
Das Modell weiß nichts über dich oder deine Situation. Liefere Hintergrund, Rahmen und Zweck mit.
Ein Beispiel des Wunschergebnisses sagt mehr als drei Sätze Erklärung. Das nennt man Few-Shot.
Tabelle, Stichpunkte, JSON, Tonfall, Länge, gib die Form vor, sonst rät das Modell.
Der erste Prompt ist selten perfekt. Nachschärfen, was nicht passt, ist die eigentliche Arbeit.
Acht reale Anwendungsfälle, die du wahrscheinlich schon im Alltag triffst, auch wenn du es nicht immer merkst.
Der bekannteste Anwendungsfall. LLMs beantworten Fragen, führen Dialoge und erinnern sich an den Kontext eines Gesprächs.
LLMs schlagen Code-Zeilen vor, erklären fremden Code, finden Bugs und schreiben Tests. Sie sind heute fester Bestandteil vieler Entwickler-Workflows.
Im Gegensatz zu regelbasierten Systemen verstehen LLMs Nuancen, Idiome und Kontext. Übersetzungen klingen oft natürlicher.
Statt nur Links anzuzeigen, fasst eine LLM-gestützte Suche Antworten direkt zusammen, inklusive Quellenangaben.
Lange Dokumente, Meeting-Protokolle, wissenschaftliche Paper, LLMs verdichten Hunderte Seiten auf das Wesentliche.
Vom Brainstorming über Marketingtexte bis zu Drehbüchern: LLMs sind hervorragende Sparringspartner für kreative Arbeit.
LLMs erklären beliebige Themen in beliebigen Schwierigkeitsgraden, geben Feedback und üben mit Lernenden, rund um die Uhr.
Texte in einfache Sprache übersetzen, Bilder beschreiben, Untertitel erzeugen, lange Texte hörbar machen. LLMs senken Hürden.
Alles davor war eine Aufzählung. Hier steht dieselbe Sache zum Mitnehmen: vier Aufgaben, wie sie in einem Betrieb wirklich anfallen, und zu jeder der fertige Prompt in den fünf Bausteinen von oben. Kopier ihn, setz deine eigenen Zahlen ein und probier ihn in deinem Chatfenster aus.
Demo 5 von 11
Posteingang, Dienstagvormittag
Hier die Notizen aus dem Kundentermin von heute Morgen. Es sollte noch raus, bevor der Kunde woanders fragt.
Der fertige Prompt
Zwei der vier Prompts tragen eine Grenze in sich: „rechne nichts, was nicht in der Liste steht“ und „markiere die unsicheren Fälle, statt sie zu ändern“. Das ist die Vier-Augen-Regel, in einen Prompt geschrieben.
Entwürfe darf es allein machen, aber alles, was mit einer Zahl, einem Preis oder einem Vertrag nach draußen geht, liest vorher ein Mensch gegen.
Ein Werkzeug einzuführen heißt, drei Dinge zu entscheiden: was es allein darf, was nie hineingehört und was es kostet.
Die meisten Betriebe scheitern nicht an der Technik, sondern daran, dass niemand gesagt hat, wofür das Ding benutzt werden soll und wofür nicht. Drei Regeln reichen für den Anfang, und sie passen auf eine Seite.
Erstens: vier Augen, wo es nach draußen geht
Ein Entwurf darf ohne Prüfung entstehen. Alles, was mit einer Zahl, einem Preis, einem Termin oder einem Satz aus dem Vertrag zum Kunden geht, liest vorher ein Mensch gegen. Das ist keine Misstrauensregel gegen die Technik, sondern dieselbe Regel, die für einen neuen Azubi auch gilt.
Zweitens: was nie in ein Chatfenster gehört
Der Grund ist einfach: Was du eintippst, verlässt deinen Betrieb. Wo es dann liegt, wie lange und wer es sieht, steht in den Bedingungen des Anbieters und nicht in deinem Vertrag mit dem Kunden.
Drittens: was es kostet
Ein Zugang für ein Team liegt bei den großen Anbietern bei etwa 20 Dollar je Kopf und Monat bei Jahresabrechnung, 25 bei monatlicher (Anthropic, Preisseite, Stand September 2026; bei OpenAI liegt der Business-Zugang in derselben Größenordnung). Das ist die Größenordnung eines Mobilfunkvertrags, nicht die einer Softwareeinführung.
Teuer wird nicht der Zugang, sondern das Anschließen: eigene Unterlagen anbinden, Abläufe festlegen, Leute einarbeiten. Das ist Einrichtungsarbeit und einmalig.
Und was ist mit dieser Seite hier?
Was du in die Demos auf dieser Seite eintippst, bleibt in deinem Browser. Die Seite setzt kein Cookie, benutzt kein Zählwerkzeug und lädt nichts von fremden Servern, auch die Schrift nicht. Es gibt hier nichts, was wir über dich erfahren.
Teil 3 von 3, Unter der Haube
Bis hierher hast du ein Modell bedient. Drei Bilder zeigen, wie es lernt, wo Bedeutung liegt und wie deine Unterlagen dazukommen.
Bilder 9 bis 11: Der Ball im Tal, Die Karte der Wörter, Der Aktenschrank
Niemand schreibt die Regeln, das Modell lernt sie, indem es das nächste Wort rät, den Fehler misst und Milliarden Zahlen etwas nachstellt.
86 MilliardenNervenzellen im Gehirn
Quelle: Azevedo u. a., 2009
Dort warten das Neuron mit seinen drei Reglern und der Ball im Tal, dessen Lernrate du stellst.
Künstliche neuronale Netze sind dem Gehirn abgeschaut. Wie nah die Maschine dem Menschen kommt, zeigt die Gegenüberstellung. Zieh Reiz A auf 1,0 und sieh, wann das Neuron feuert.
Schon 1943 bauten McCulloch & Pitts ein mathematisches Modell des Neurons. 1958 folgte das „Perceptron“, ein erstes lernfähiges Netz. Die Vision dahinter heißt Kybernetik: die Wissenschaft, wie Steuerung, Rückkopplung und Lernen in lebenden und künstlichen Systemen funktionieren. Genau aus dieser Idee sind moderne LLMs entstanden.
Demo 6 von 11
Signale kommen über die Dendriten rein. Übersteigt die Summe im Zellkörper eine Schwelle, „feuert“ das Neuron ein Signal über das Axon.
Jeder Eingang wird mit einem Gewicht multipliziert, alles summiert, und eine Aktivierungsfunktion entscheidet die Ausgabe.
Genau dieses Prinzip, also Eingänge mal Gewichte, summieren und aktivieren, wiederholt sich in einem LLM milliardenfach, organisiert in Schichten. Aus diesem einfachen Baustein entsteht alles, was du als „Intelligenz“ des Modells erlebst.
Der Kern-Gedanke der Kybernetik (Norbert Wiener, 1948): Systeme lernen und steuern sich durch Feedback. Sie vergleichen Ist und Soll und korrigieren. Das gilt für den Menschen genauso wie für die KI.
Du greifst nach einer Tasse. Deine Augen melden laufend, wie weit die Hand noch entfernt ist, dein Gehirn korrigiert die Bewegung in Echtzeit. Sensorisches Feedback, tausendfach pro Sekunde, bis die Hand die Tasse hält.
Beim Training rät das Modell das nächste Wort, vergleicht mit der Wahrheit und misst den Fehler. Backpropagation schickt diesen Fehler rückwärts durchs Netz und justiert jedes Gewicht ein winziges Stück, millionenfach, bis die Vorhersagen stimmen.
~86 Milliarden Neuronen, biochemisch verschaltet
Milliarden künstliche „Neuronen“ (Parameter), reine Mathematik
Synapsen verstärken sich: „what fires together, wires together“
Gewichte werden angepasst, per Backpropagation aus Fehlern
~20 Watt, etwa eine Glühbirne
Megawatt, ein ganzes Rechenzentrum fürs Training
Lernt aus wenigen Beispielen, oft aus einem einzigen
Braucht Milliarden Beispiele, um Muster zu lernen
Assoziativ, rekonstruktiv und vergisst aktiv
Fix nach dem Training + flüchtiges Kontextfenster
Multimodal & kontinuierlich: Augen, Ohren, Haut, Körper
Diskrete Tokens, Text, Bild oder Audio in Zahlen zerlegt
Hat einen Körper, handelt und lernt in der echten Welt
Kein Körper, lebt nur in Daten und Sprache
Echtes Verstehen, Bedeutung, Bewusstsein
Statistische Muster, beeindruckend, aber ohne Bewusstsein
Bevor ein Modell ein Wort vorhersagt, muss es aus Beispielen lernen. Das ist anders, als ein Computer sonst arbeitet. Setz die Lernrate auf 1,1 und schau dem Ball zu.
Normalerweise schreibt ein Mensch jede Regel von Hand. Maschinelles Lernen dreht das um: Man füttert das System mit Beispielen und Lösungen und es findet die Regeln selbst.
Der Mensch denkt sich jede Regel aus und schreibt sie als Code. Der Computer führt sie nur stur aus. Für „Ist das eine Katze?“ müsste man unmöglich viele Regeln von Hand formulieren.
Man zeigt nur Beispiele mit Lösung. Das Modell sucht sich die Regeln selbst, versteckt in Millionen kleiner Stellschrauben, den Gewichten. Niemand programmiert „Katze“ explizit aus.
Lernen mit Musterlösung. Man zeigt dem Modell tausende Beispiele samt richtiger Antwort, „dieses Bild ist eine Katze, jenes ein Hund“, bis es die Zuordnung selbst beherrscht.
Beim LLM: Ein LLM lernt so das nächste Wort: Der Text selbst liefert die „richtige Antwort“ gleich mit (self-supervised).
Muster finden ganz ohne Lösungen. Das Modell bekommt nur Rohdaten und sortiert sie selbst in Gruppen, etwa Kunden mit ähnlichem Verhalten.
Beim LLM: Verwandt damit lernen Embeddings, welche Wörter sich ähneln, ohne dass jemand das vorgibt.
Lernen durch Belohnung und Bestrafung. Das Modell probiert, bekommt Punkte für gutes Verhalten und passt sich an, wie beim Üben eines Spiels.
Beim LLM: Genau so wird ein Chatbot mit menschlichem Feedback feingeschliffen (RLHF), hilfreiche Antworten werden belohnt.
Lernen ist im Kern eine Schleife, die sich millionenfach wiederholt. Stell dir den Fehler als Tal vor und das Modell als Ball: Bei jedem Schritt rollt der Ball ein Stück bergab, dahin, wo der Fehler kleiner wird. Dieses Verfahren heißt Gradientenverfahren (Gradient Descent).
Das Modell macht eine Vorhersage, am Anfang fast zufällig.
Wie weit liegt die Vorhersage daneben? Diese Zahl heißt Loss.
Der Gradient verrät, wie man jedes Gewicht ändern muss, damit der Fehler kleiner wird.
Jedes Gewicht rückt ein winziges Stück in die bessere Richtung.
Demo 7 von 11
Hier steuert ein Gewicht den Fehler. Probiere die Lernrate: zu klein und der Ball kriecht, genau richtig und er sitzt nach wenigen Sprüngen im Tal, zu groß und er schießt hinaus und wird nie fertig. Diese eine Stellschraube zu treffen, ist eine der wichtigsten Aufgaben beim Training.
Ein LLM rät beim Training immer wieder das nächste Wort, misst mit dem Loss, wie falsch es lag, und justiert dann seine Milliarden Gewichte ein winziges Stück in die richtige Richtung. Das Tal hat hier nicht eine, sondern Milliarden Achsen, doch die Regel bleibt dieselbe: bergab, bis der Fehler klein ist.
Den Trick, der den Fehler effizient durch alle Schichten zurückrechnet, hast du in Mensch vs. KI schon getroffen: die Backpropagation. Sie liefert für jedes einzelne Gewicht den passenden Schritt, milliardenfach, über Billionen von Textbeispielen.
Im Modell ist jedes Wort ein Punkt auf einer Karte, und König liegt neben Königin, weil beide in ähnlichen Sätzen vorkommen.
16.384Zahlen je Wortstück
Quelle: Meta 2024, Brown u. a. 2020
Dort wartet das Aufmerksamkeitsgitter, in dem du jedes Wort anklickst.
Zwei Ideen tragen ein Sprachmodell: Embeddings, also Wörter als Zahlen mit Bedeutung, und Attention, also Wörter, die aufeinander schauen. Tipp auf König und such, wo Königin liegt.
Ähnliche Wörter liegen nah beieinander, ganz ohne dass jemand das explizit programmiert hätte.
Demo 8 von 11
Die Punkte hier sind von Hand gesetzt, um das Prinzip zu zeigen. Echte Embeddings haben hunderte bis tausende Dimensionen; für ein Bild wie dieses rechnet man sie auf zwei herunter. Im Modell sind die Räume so reich, dass auch Beziehungen wie „König minus Mann plus Frau ergibt Königin“ funktionieren. Hier ist genau das eingezeichnet: der Weg von Mann zu Frau ist derselbe wie der von König zu Königin.
Klicke auf ein Wort, um zu sehen, wohin es seine Aufmerksamkeit richtet.
Demo 9 von 11
Jede Zelle zeigt, wie stark ein Token (Zeile) ein anderes Token (Spalte) „beachtet“. In den späteren Layern lernt das Modell oft Referenzen aufzulösen, das Pronomen „sie“ schaut z.B. auf „Katze“ zurück. So entsteht aus Wortvektoren echtes Kontextverständnis. Die Zellenwerte hier sind Lernbeispiele, keine Modellausgabe.
Schließt du deine Unterlagen an, antwortet das Modell daraus wie ein Berater aus seinem Aktenschrank und nennt die Stelle zum Nachprüfen.
126Schichten rechnen jede Antwort
Quelle: Meta 2024, Brown u. a. 2020
Dort wartet der Ablauf, den du Schritt für Schritt abspielst.
Die Layer machen ein Modell denkfähig, RAG verbindet das mit deinem eigenen Wissen. Klick dich Schritt für Schritt durch die Anfrage.
Ein LLM ist ein Stapel aus Transformer-Layern. Tipp auf einen Layer, die Karte daneben erklärt ihn. Frühe Layer arbeiten an Syntax, mittlere an Bedeutung, späte an konkreter Aufgabenlogik.
Demo 10 von 11
Jedes Token (Wortteil) bekommt einen Vektor mit hunderten oder tausenden Dimensionen. Semantisch ähnliche Wörter („König“ und „Königin“) landen im Vektorraum nahe beieinander. Das ist die mathematische Grundlage dafür, dass das Modell überhaupt Bedeutung verarbeiten kann.
Ein LLM kennt nur, was es im Training gesehen hat und kann nicht auf deine privaten Dokumente zugreifen. RAG (Retrieval Augmented Generation) löst beides. Drück „Abspielen“, um den 6-Schritt-Flow live zu sehen.
Demo 11 von 11
Es koppelt die Sprachfähigkeit eines LLMs mit aktuellem, privatem oder spezifischem Wissen. Du musst das Modell nicht neu trainieren (extrem teuer), du pflegst nur deine Wissensbasis. Das LLM antwortet aus deinen Quellen und nennt sie. Halluzinationen werden damit seltener, nicht unmöglich, und aktuell ist es genau so weit, wie deine Wissensbasis gepflegt ist.
Die Layer bilden die generelle Intelligenz, Sprache, Logik, Weltwissen. RAG erweitert das um spezifisches Wissen on demand. Erst die Kombination macht ein LLM wirklich nützlich für deinen Use Case.
Ein weiterer Layer obendrauf sind Tools (Funktionen, die das LLM aufrufen kann: Web Search, Code-Ausführung, MCP-Server). Damit verlässt das Modell den reinen Text-Modus und wird zum Agenten. RAG ist im Grunde eine spezialisierte Form davon, ein Such-Tool für deine eigene Wissensbasis.
Ein Agent ist dasselbe Modell mit Werkzeugen: Es rät den nächsten Handgriff, Datei lesen, schreiben, Befehl ausführen, und sieht das Ergebnis.
Bis hierher ging es um Modelle, die Text erzeugen. Werkzeuge wie Claude Code gehen einen Schritt weiter: Sie arbeiten in deinen Dateien. Der Sprung wirkt groß, ist im Kern aber derselbe Mechanismus, den du oben selbst angeklickt hast.
Bei der Wort-Vorhersage weiter oben hast du aus einer Liste das nächste Wort gewählt. Ein Agent macht nichts anderes. Nur darf eines der vorhergesagten Stücke kein Wort sein, sondern ein Werkzeugaufruf: Datei lesen, Datei schreiben, Befehl ausführen.
Das Modell selbst öffnet keine Datei. Es sagt voraus, dass jetzt ein Werkzeugaufruf sinnvoll wäre. Ein Programm drumherum führt ihn aus und legt das Ergebnis zurück in den Kontext. Genau deshalb zählt alles, was du über Kontextfenster gelernt hast, hier doppelt.
Du sagst, was herauskommen soll. Etwa: sortiere diese Belege nach Kategorie.
Das Modell sagt voraus, welcher Schritt als nächstes kommt. Diesmal ist das kein Wort, sondern ein Werkzeugaufruf.
Nicht das Modell öffnet die Datei, sondern ein Programm um es herum. Es reicht das Ergebnis zurück.
Das Ergebnis kommt als neuer Kontext hinein, und die Runde beginnt von vorn, bis das Ziel erreicht ist.
Ehrlich gesagt: Diese Seite hier ist mit Claude Code gebaut, samt der Demos, die du angeklickt hast. Das ist kein Gütesiegel, sondern nur der Hinweis, dass die Beispiele aus echter Arbeit stammen und nicht aus einer Broschüre.
Erklären heißt vereinfachen, aber nicht erfinden. Die zentralen Zahlen dieser Seite stehen hier mit ihrer Quelle. Wo es keine belastbare Zahl gibt, steht eine Größenordnung.
Gemessen 86,1 ± 8,1 Milliarden. Die früher übliche Zahl von 100 Milliarden war nie belegt.
Im Februar 2019 vorgestellt, die vollständige Fassung kam im November desselben Jahres.
GPT-2 50.257, GPT-4 100.277, Llama 3 128.256, GPT-4o 200.019 Einträge.
Rund 550.000 bis 750.000 Wörter, je nach Tokenizer des Modells. Auch Google führt für Gemini seit Längerem eine Million und mehr.
Sieben Autorinnen und Autoren um Nelson Liu, gemessen an Fragen über mehrere Dokumente und an Schlüssel-Wert-Abruf, wiederholt bei sechs Modellfamilien. Der Verlauf ist belegt, eine Prozentzahl nennt das Abstract nicht, deshalb trägt die Kurve auf der Seite keine.
Die Arbeit, auf der praktisch jedes heutige Sprachmodell aufbaut.
Llama 3 405B: 126 Schichten, Modellbreite 16.384, 128 Attention-Köpfe (Tabelle 3). GPT-3 175B: 96 Schichten (Tabelle 2.1, arxiv.org/abs/2005.14165).
Das erste Rechenmodell eines Neurons, die erste lernende Maschine und das Buch, das die Rückkopplung zum Prinzip machte.
Der Ansatz hinter dem Rat, wichtige Fragen mehrfach zu stellen, statt der ersten Antwort zu glauben.
Dort ist der Bereich 0 bis 1, Standard 1,0; auf den neuesten Modellen wird jeder andere Wert abgelehnt. OpenAI erlaubt 0 bis 2.
Zwanzig Dollar je Platz und Monat bei Jahresabrechnung, fünfundzwanzig bei monatlicher, für Teams von zwei bis 150 Personen. Bei OpenAI liegt der Business-Zugang in derselben Größenordnung.
Zuletzt geprüft im September 2026. Modelle und Zahlen ändern sich schnell. Was hier steht, war zu diesem Zeitpunkt belegbar.
Parameterzahlen heutiger Spitzenmodelle. Die Anbieter veröffentlichen sie seit Jahren nicht mehr, kursierende Werte stammen aus Leaks. Deshalb steht hier eine Größenordnung statt einer Zahl, die genau aussieht und es nicht ist.
Werkzeuge anschließen, eigene Unterlagen anbinden, den passenden Fall im Betrieb finden: das ist die Einrichtungsarbeit, und die macht Zweitkopf in Ostwestfalen. Der erste Schritt ist ein Rückruf, das Erstgespräch kostet nichts.