Moderne Architekturen

Was ist Attention?

Attention verständlich erklärt: gewichteter Zugriff auf alle Eingaben, Query, Key und Value, Self-Attention und warum Attention Transformer möglich macht.

Schwierigkeit
Fortgeschritten
Lesezeit
ca. 3 Min.
Aktualisiert
5.8.2026
Voraussetzung
RNN

Kurz erklärt

Attention ist ein Mechanismus, mit dem ein neuronales Netz für jede Position einer Eingabe entscheidet, welche anderen Positionen dafür wichtig sind. Statt Informationen schrittweise durch einen einzigen Zustand zu schleusen, greift das Modell gewichtet auf alle Elemente gleichzeitig zu. Technisch werden dazu Anfragen (Query), Schlüssel (Key) und Werte (Value) verglichen; die Ähnlichkeit von Query und Key bestimmt, wie stark ein Wert in das Ergebnis einfließt.

Warum gibt es Attention?

In der maschinellen Übersetzung mussten frühe Modelle einen ganzen Satz in einen einzigen Zustandsvektor pressen. Bei langen Sätzen war dieser Engpass die entscheidende Fehlerquelle. Bahdanau und Kollegen schlugen 2014 vor, dem Decoder Zugriff auf alle Zustände des Encoders zu geben – gewichtet danach, was für das gerade zu erzeugende Wort relevant ist.

Wie funktioniert Attention?

Ebene 1, verständlich: Für jedes Wort stellt das Modell die Frage „Welche anderen Wörter brauche ich, um dieses hier zu verstehen?“. Es vergibt Aufmerksamkeitsgewichte, die zusammen 100 Prozent ergeben, und bildet daraus eine gewichtete Zusammenfassung.

DieMonteurinholtedieLeiterweilsieAufmerksamkeit von „sie“ auf die übrigen Wörter
Für das Wort „sie“ verteilt das Modell seine Aufmerksamkeit auf die übrigen Wörter des Satzes.

Query, Key und Value

Technischer Blick

  • Aus jedem Eingabevektor werden drei Vektoren erzeugt: Query (wonach suche ich), Key (wofür stehe ich), Value (welche Information trage ich bei).
  • Das Skalarprodukt von Query und Key misst die Passung zweier Positionen.
  • Skalierung durch √dₖ verhindert, dass die Werte bei hoher Dimension zu groß werden.
  • Softmax normiert die Werte zu Gewichten, die sich zu 1 summieren.
  • Formel: Attention(Q,K,V) = softmax(QKᵀ/√dₖ)·V.
  • Self-Attention: Query, Key und Value stammen aus derselben Sequenz – jedes Element schaut auf alle anderen.

Ein einfaches Beispiel

Im Satz „Die Monteurin holte die Leiter, weil sie zu kurz war“ bezieht sich „sie“ auf die Leiter. Ein Attention-Kopf lernt, dem Wort „Leiter“ ein hohes Gewicht zu geben, wenn er „sie“ verarbeitet. Es gibt keine Regel dafür – die Zuordnung entsteht aus dem Training.

Stärken und Grenzen

  • Stärke: direkter Zugriff auf weit entfernte Positionen, ohne Umweg über viele Zwischenschritte.
  • Stärke: alle Positionen lassen sich gleichzeitig berechnen, was Training auf Grafikprozessoren stark beschleunigt.
  • Stärke: die Gewichte geben einen gewissen Einblick, worauf ein Modell reagiert.
  • Grenze: Rechenaufwand und Speicher wachsen quadratisch mit der Sequenzlänge.
  • Grenze: Attention allein kennt keine Reihenfolge; sie muss über Positionsinformation ergänzt werden.
  • Grenze: Aufmerksamkeitsgewichte sind kein Beweis für eine Begründung des Modells.

Zusammenhang mit anderen KI-Technologien

Attention entstand als Zusatz zu rekurrenten Modellen. Der Transformer machte sie zum tragenden Bauteil und verzichtete auf die Rekurrenz vollständig. Alle heutigen großen Sprachmodelle beruhen auf Self-Attention.

Häufige Fragen – kurz beantwortet

Jede Antwort ist eigenständig verständlich, auch ohne den restlichen Artikel.

Was ist Attention?

Attention ist ein Mechanismus, der beim Verarbeiten eines Elements gewichtet auf alle anderen Elemente der Eingabe zugreift. Für jedes Elementpaar wird eine Relevanzgewichtung berechnet, und die Ausgabe ist die gewichtete Summe der zugehörigen Wertvektoren.

Was bedeuten Query, Key und Value?

Aus jeder Eingaberepräsentation werden drei Vektoren abgeleitet. Der Query beschreibt, wonach eine Position sucht, der Key beschreibt, was eine Position anbietet, und der Value enthält die weiterzugebende Information. Die Ähnlichkeit von Query und Key bestimmt über eine Softmax-Funktion die Gewichtung der Values.

Was ist Self-Attention?

Bei Self-Attention stammen Query, Key und Value aus derselben Sequenz. Jede Position bezieht damit Kontext aus allen übrigen Positionen derselben Eingabe, was Bezüge wie Pronomen oder weit entfernte Satzteile abbildbar macht.

Welche Grenzen besitzt Attention?

Der Rechen- und Speicheraufwand klassischer Self-Attention wächst quadratisch mit der Sequenzlänge, was sehr lange Eingaben teuer macht. Attention-Gewichte zeigen zudem Bezüge im Modell an, sie sind keine Erklärung der inhaltlichen Korrektheit einer Ausgabe.

Einordnung im Wissensnetz

Hauptthema dieser Seite
Attention-Mechanismus
Verwandte Begriffe
Transformer · Self-Attention · Sequenzmodellierung

Fachliche Grundlage: RNN. Der nächste Schritt im Lernpfad ist Transformer.

Quellen & weiterführendes Lernen

Belege für die fachlichen Aussagen dieses Artikels und ausgewählte externe Lernangebote. Externe Anbieter sind keine Partner von Mojora AI.

Quellen

Weiterlernen