Zum Inhalt springen

LLMs verstehen

Lernseite von Zweitkopf

Wie funktioniert eigentlich KI?

Diese Überschrift hätte auch anders enden können, mit ChatGPT, Claude oder Gemini. Ein Sprachmodell wählt jedes Wort aus Kandidaten mit Wahrscheinlichkeiten, eins nach dem anderen.

  • 12 Bilder
  • 15 Stationen, 11 Demos
  • 6 oder 25 Minuten
Erstes Bild: Wort für Wort

Teil 1 von 3, Grundidee

Ein Sprachmodell tut genau eine Sache: Es sagt das nächste Wort voraus. Vier Bilder zeigen, was daraus folgt.

Bilder 1 bis 4: Wort für Wort, Die Stücke, Die Wahl, Der Regler

Wort für Wort

Dein Handy schlägt dir das nächste Wort vor, und ein Sprachmodell wie ChatGPT macht genau das, nur für ganze Antworten.

Die Stücke

Ein Sprachmodell liest keine Wörter, sondern Stücke, sogenannte Tokens, und schon die Überschrift oben zerfällt in mehr Stücke als Wörter.

128.256Stücke kennt Llama 3

Quelle: tiktoken und Llama 3

Dort wartet der Zerleger, in den du deinen eigenen Satz tippst.

Die Wahl

Die Überschrift oben war eine Wahl: Jeder Kandidat bekam eine Zahl, einer gewann, und die Zahl verschwindet, sobald das Wort steht.

Dort wartet die Kandidatenliste, aus der du das nächste Wort selbst wählst.

Der Regler

Dass dasselbe Modell auf dieselbe Frage zweimal anders antwortet, liegt an einem Regler, der Temperatur, und im Chatfenster siehst du ihn nicht.

Dort wartet der Regler, den du von null bis zwei drehst.

Teil 2 von 3, Im Alltag

Was das Raten für dich bedeutet: wo es danebenliegt und wie du es lenkst.

Bilder 5 bis 8: Raten statt wissen, Das Fenster, Das Lenkrad, Die vier Augen

Raten statt wissen

Das Modell rät und weiß nichts, deshalb klingt es auch im Irrtum sicher: Entwürfe ja, aber Zahlen, Verträge und Quellen nur geprüft.

Das Fenster

Ein Modell sieht immer nur, was gerade in seinem Fenster steht, und was da nicht hineinpasst, kennt es nicht.

1 MillionTokens passen ins Fenster

Quelle: Anthropic, Modellübersicht und Liu u. a., TACL 2023

Dort wartet die Kurve, die zeigt, wo im Fenster gefunden wird.

Das Lenkrad

Dasselbe Modell für alle, das Lenkrad ist deine Frage, und mit Rolle, Kontext und Format wird aus der Rückfrage ein Entwurf.

Dort warten das Prompt-Labor, in dem du fünf Bausteine zuschaltest und der Posteingang, aus dem du dir einen fertigen Prompt kopierst.

Die vier Augen

Entwürfe darf es allein machen, aber alles, was mit einer Zahl, einem Preis oder einem Vertrag nach draußen geht, liest vorher ein Mensch gegen.

Teil 3 von 3, Unter der Haube

Bis hierher hast du ein Modell bedient. Drei Bilder zeigen, wie es lernt, wo Bedeutung liegt und wie deine Unterlagen dazukommen.

Bilder 9 bis 11: Der Ball im Tal, Die Karte der Wörter, Der Aktenschrank

Der Ball im Tal

Niemand schreibt die Regeln, das Modell lernt sie, indem es das nächste Wort rät, den Fehler misst und Milliarden Zahlen etwas nachstellt.

86 MilliardenNervenzellen im Gehirn

Quelle: Azevedo u. a., 2009

Dort warten das Neuron mit seinen drei Reglern und der Ball im Tal, dessen Lernrate du stellst.

Die Karte der Wörter

Im Modell ist jedes Wort ein Punkt auf einer Karte, und König liegt neben Königin, weil beide in ähnlichen Sätzen vorkommen.

16.384Zahlen je Wortstück

Quelle: Meta 2024, Brown u. a. 2020

Dort wartet das Aufmerksamkeitsgitter, in dem du jedes Wort anklickst.

Der Aktenschrank

Schließt du deine Unterlagen an, antwortet das Modell daraus wie ein Berater aus seinem Aktenschrank und nennt die Stelle zum Nachprüfen.

126Schichten rechnen jede Antwort

Quelle: Meta 2024, Brown u. a. 2020

Dort wartet der Ablauf, den du Schritt für Schritt abspielst.

Der Handgriff

Ein Agent ist dasselbe Modell mit Werkzeugen: Es rät den nächsten Handgriff, Datei lesen, schreiben, Befehl ausführen, und sieht das Ergebnis.

Belege

Woher die Zahlen kommen

Erklären heißt vereinfachen, aber nicht erfinden. Die zentralen Zahlen dieser Seite stehen hier mit ihrer Quelle. Wo es keine belastbare Zahl gibt, steht eine Größenordnung.

86 Milliarden Neuronen im menschlichen Gehirn
Azevedo u. a., Journal of Comparative Neurology, 2009

Gemessen 86,1 ± 8,1 Milliarden. Die früher übliche Zahl von 100 Milliarden war nie belegt.

GPT-2 hatte 1,5 Milliarden Parameter
OpenAI, Model Card zu GPT-2, 2019

Im Februar 2019 vorgestellt, die vollständige Fassung kam im November desselben Jahres.

Wortschatz von rund 50.000 bis 200.000 Tokens
OpenAI, tiktoken; Meta, Llama-3-Arbeit

GPT-2 50.257, GPT-4 100.277, Llama 3 128.256, GPT-4o 200.019 Einträge.

Kontextfenster von einer Million Tokens
Anthropic, Modellübersicht

Rund 550.000 bis 750.000 Wörter, je nach Tokenizer des Modells. Auch Google führt für Gemini seit Längerem eine Million und mehr.

Im Fenster wird am Anfang und am Ende besser gefunden als in der Mitte
Liu u. a., „Lost in the Middle: How Language Models Use Long Contexts“, TACL 2023

Sieben Autorinnen und Autoren um Nelson Liu, gemessen an Fragen über mehrere Dokumente und an Schlüssel-Wert-Abruf, wiederholt bei sechs Modellfamilien. Der Verlauf ist belegt, eine Prozentzahl nennt das Abstract nicht, deshalb trägt die Kurve auf der Seite keine.

Die Transformer-Architektur und der Attention-Mechanismus
Vaswani u. a., „Attention Is All You Need“, 2017

Die Arbeit, auf der praktisch jedes heutige Sprachmodell aufbaut.

GPT-3 mit 96 Schichten, Llama 3 (405 Milliarden Parameter) mit 126
Meta, „The Llama 3 Herd of Models“, 2024; Brown u. a., „Language Models are Few-Shot Learners“, 2020

Llama 3 405B: 126 Schichten, Modellbreite 16.384, 128 Attention-Köpfe (Tabelle 3). GPT-3 175B: 96 Schichten (Tabelle 2.1, arxiv.org/abs/2005.14165).

Die Jahreszahlen zum Neuron, zum Perceptron und zur Kybernetik
McCulloch und Pitts 1943, Rosenblatt 1958, Wiener 1948

Das erste Rechenmodell eines Neurons, die erste lernende Maschine und das Buch, das die Rückkopplung zum Prinzip machte.

Mehrfach rechnen lassen und die häufigste Antwort nehmen hilft
Wang u. a., „Self-Consistency Improves Chain of Thought Reasoning“, 2022

Der Ansatz hinter dem Rat, wichtige Fragen mehrfach zu stellen, statt der ersten Antwort zu glauben.

Temperature lässt sich nicht bei jedem Anbieter frei setzen
Anthropic, Referenz der Messages-Schnittstelle

Dort ist der Bereich 0 bis 1, Standard 1,0; auf den neuesten Modellen wird jeder andere Wert abgelehnt. OpenAI erlaubt 0 bis 2.

Ein Team-Zugang kostet rund 20 Dollar je Kopf und Monat
Anthropic, Preisseite, geprüft im September 2026

Zwanzig Dollar je Platz und Monat bei Jahresabrechnung, fünfundzwanzig bei monatlicher, für Teams von zwei bis 150 Personen. Bei OpenAI liegt der Business-Zugang in derselben Größenordnung.

Stand der Angaben

Zuletzt geprüft im September 2026. Modelle und Zahlen ändern sich schnell. Was hier steht, war zu diesem Zeitpunkt belegbar.

Was hier bewusst fehlt

Parameterzahlen heutiger Spitzenmodelle. Die Anbieter veröffentlichen sie seit Jahren nicht mehr, kursierende Werte stammen aus Leaks. Deshalb steht hier eine Größenordnung statt einer Zahl, die genau aussieht und es nicht ist.

Und wie funktioniert das eigentlich in deinem Betrieb?

Für mein Team

Werkzeuge anschließen, eigene Unterlagen anbinden, den passenden Fall im Betrieb finden: das ist die Einrichtungsarbeit, und die macht Zweitkopf in Ostwestfalen. Der erste Schritt ist ein Rückruf, das Erstgespräch kostet nichts.