Softmax-Funktion
In der Mathematik ist die sogenannte Softmax-Funktion oder normalisierte Exponentialfunktion[1] eine Verallgemeinerung der logistischen Funktion, die ei…
In der Mathematik ist die sogenannte Softmax-Funktion oder normalisierte Exponentialfunktion[1] eine Verallgemeinerung der logistischen Funktion, die einen -dimensionalen Vektor mit reellen Komponenten in einen -dimensionalen Vektor ebenfalls als Vektor reeller Komponenten in den Wertebereich transformiert, wobei sich die Komponenten zu aufsummieren. Der Wert kommt nur im Sonderfall vor.
Die Softmax-Funktion ist gegeben durch:
- für j = 1, …, K.
Zusammenhang zur Logit-Funktion

Bei der binären logistischen Regression benötigt man zur vollständigen Beschreibung lediglich die Wahrscheinlichkeit einer Klasse: . Für zwei Klassen ist die Softmax-Funktion:
- für j = 1, 2 und .
Da die um eine beliebige Konstante verschoben werden können ohne das Ergebnis zu ändern, gilt:
mit und der Inversen der Logit-Funktion.
Alternativen
Softmax erzeugt Wahrscheinlichkeitsvorhersagen, welche über ihrem Träger dicht besetzt sind. Andere Funktionen wie sparsemax oder -entmax können benutzt werden, wenn dünn besetzte Wahrscheinlichkeitsvorhersagen erzeugt werden sollen.[2]
Verwendung
Wahrscheinlichkeitstheorie
In der Wahrscheinlichkeitstheorie kann die Ausgabe der Softmax-Funktion genutzt werden, um eine kategoriale Verteilung – also eine Wahrscheinlichkeitsverteilung über unterschiedliche mögliche Ereignisse – darzustellen. Tatsächlich entspricht dies der gradient-log-Normalisierung der kategorialen Wahrscheinlichkeitsverteilung. Somit ist die Softmax-Funktion der Gradient der LogSumExp-Funktion.
Multiklassen-Klassifikation
Die Softmax-Funktion wird in verschiedenen Methoden der Multiklassen-Klassifikation verwendet, wie bspw. bei der multinomialen logistischen Regression (auch bekannt als Softmax-Regression),[1][3] der multiklassen-bezogenen linearen Diskriminantenanalyse, bei naiven Bayes-Klassifikatoren und künstlichen neuronalen Netzen.[4] Insbesondere in der multinomialen logistischen Regression sowie der linearen Diskriminantenanalyse entspricht die Eingabe der Funktion dem Ergebnis von distinkten linearen Funktionen, und die ermittelte Wahrscheinlichkeit für die -te Klasse gegeben ein Stichprobenvektor und einem Gewichtsvektor entspricht:
Dies kann angesehen werden als Komposition von linearen Funktionen und der Softmax-Funktion (wobei das innere Produkt von und bezeichnet). Die Ausführung ist äquivalent zur Anwendung eines linearen Operators definiert durch bei Vektoren , so dass dadurch die originale, möglicherweise hochdimensionale Eingabe in Vektoren im -dimensionalen Raum transformiert wird.
Transformer
Softmax ist ein Baustein der „Aufmerksamkeit“-Algorithmen[5] (Teil der sogenannten Transformer[6]) moderner Large Language Models (LLMs). Softmax wandelt einen Vektor von Rohwerten (Logits) in Wahrscheinlichkeiten um, deren Summe eins ergibt.
Siehe auch
- Die kanonische Zustandssumme , auch Normalisierungskonstante genannt, ist eine Funktion aus der statistischen Physik bzw. statistischen Mechanik. Sie normalisiert die Wahrscheinlichkeitsverteilung der Zustände in einem Teilchensystem, da die Gesamtwahrscheinlichkeit, das System in einem bestimmten Mikrozustand zu finden, gleich 1 sein muss.
Einzelnachweise
- ↑ a b Christopher M. Bishop: Pattern Recognition and Machine Learning (= Information science and statistics). Springer, New York 2006, ISBN 978-0-387-31073-2 (englisch, archive.org [abgerufen am 4. April 2026]).
- ↑ Maxat Tezekbayev et al.: Speeding Up Entmax. In: Arxiv. 19. Mai 2022, abgerufen am 4. April 2026 (englisch).
- ↑ Computer Science Department: Unsupervised Feature Learning and Deep Learning Tutorial. Stanford University, abgerufen am 30. Januar 2019 (englisch).
- ↑ Sophia Tamm: Einführung in neuronale Netze. In: Seminar Maschinelles Lernen - Dr. Zoran Nikolić. Universität Köln, 30. Mai 2019, abgerufen am 24. Mai 2022.
- ↑ Zhaoyang Niu et al.: A review on the attention mechanism of deep learning. In: Neurocomputing. Band 452, 10. September 2021, ISSN 0925-2312, S. 48–62, doi:10.1016/j.neucom.2021.03.091 (englisch, sciencedirect.com [abgerufen am 4. April 2026]).
- ↑ Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N. Gomez, Lukasz Kaiser, Illia Polosukhin: Attention Is All You Need. In: ArXiv. 2. August 2023, abgerufen am 1. April 2026 (englisch, 1. Veröffentlichung im Jahr 2017 ; aktualisiert bis 2023).
Content Disclaimer
Informasi ini disarikan dari Wikipedia dan disajikan kembali untuk tujuan edukasi. Konten tersedia di bawah lisensi CC BY-SA 3.0. Kami tidak bertanggung jawab atas ketidakakuratan data yang bersumber dari kontribusi publik tersebut.
- The information displayed on this website is sourced in part or in whole from Wikipedia and has been adapted for the purpose of restating it. We strive to provide accurate and relevant information, however:
- There is no guarantee of absolute accuracy. Wikipedia is an open, collaborative project that can be edited by anyone, so information is subject to change.
- It is not intended to constitute professional advice. The content displayed is for informational and educational purposes only. For important decisions (e.g., medical, legal, or financial), please consult a professional.
- Content copyright. Wikipedia is licensed under the Creative Commons Attribution-ShareAlike License (CC BY-SA). This means that content may be reused with appropriate attribution and shared under a similar license.
- Responsible use. Any risk arising from the use of information from this website is entirely the responsibility of the user.