NETtalk

NETtalk ist ein künstliches neuronales Netz, das Mitte der 1980er Jahre von Terrence J. Sejnowski und Charles Rosenberg erstellt wurde und geschriebenen (engli…

NETtalk

NETtalk ist ein künstliches neuronales Netz, das Mitte der 1980er Jahre von Terrence J. Sejnowski und Charles Rosenberg erstellt wurde und geschriebenen (englischsprachigen) Text in eine Codierung der Aussprache umwandelt (es werden also durch Sprachsynthese Grapheme in Phoneme umgewandelt).

Aufbau

NETtalk ist ein aus drei Schichten aufgebautes Multilagenperzeptron mit sieben Gruppen zu je 29 Neuronen in der Eingabe-, 80 Neuronen in der versteckten und 26 Neuronen in der Ausgabeschicht. Jede der Gruppen in der Eingabeschicht codiert einen Buchstaben des Eingabeworts (die 29 Neuronen entsprechen dabei den 26 Buchstaben des Alphabets und jeweils einem Neuron für Leerzeichen, Satzende und sonstiger Zeichensetzung), die vierte Gruppe repräsentiert dabei den Buchstaben, dessen zugehöriges Phonem das Netz ermitteln soll, die restlichen Gruppen stellen den für die korrekte Ermittlung unerlässlichen Kontext der drei vorhergehenden bzw. nachfolgenden Buchstaben dar.

Zum Training des Netzes wurden korrekte Graphem-Phonem-Kombinationen verwendet, es handelt sich also um eine Methode des überwachten Lernens.

Leistung

Nach 50 Trainingsdurchläufen auf einem Datensatz von 1024 Wörtern erreichte das Netz eine Genauigkeit von 95 % auf den Trainings- und 78 % auf den Testdaten.

Einfluss

In den 1980er Jahren stellte NETtalk eine der aufsehenerregenden Anwendungen dar, die viele Wissenschaftler wieder dazu brachte, Forschung im Bereich des Konnektionismus durchzuführen. Kritiker bezweifeln allerdings, dass dies an der Qualität der Architektur lag (ähnliche Erfolge konnten auch mit 'herkömmlichen' Programmen erzielt werden). Vielmehr wird auf die Präsentation des Lernvorgangs des Netzes verwiesen: Die vom Netz ausgegebenen Phoneme wurden als gesprochene Sprache ausgegeben, das Programm begann also mit unverständlicher Aneinanderreihung von Lauten und verbesserte sich allmählich zu verständlicher Sprache. Darüber hinaus wurde für diese Präsentation eine Stimme mit hoher Tonlage verwendet, so dass sich für die Zuhörer der Eindruck ergab, ein Kind lerne zu sprechen.

Tonbeispiel

Siehe auch

Literatur

Content Disclaimer

Informasi ini disarikan dari Wikipedia dan disajikan kembali untuk tujuan edukasi. Konten tersedia di bawah lisensi CC BY-SA 3.0. Kami tidak bertanggung jawab atas ketidakakuratan data yang bersumber dari kontribusi publik tersebut.

  1. The information displayed on this website is sourced in part or in whole from Wikipedia and has been adapted for the purpose of restating it. We strive to provide accurate and relevant information, however:
  2. There is no guarantee of absolute accuracy. Wikipedia is an open, collaborative project that can be edited by anyone, so information is subject to change.
  3. It is not intended to constitute professional advice. The content displayed is for informational and educational purposes only. For important decisions (e.g., medical, legal, or financial), please consult a professional.
  4. Content copyright. Wikipedia is licensed under the Creative Commons Attribution-ShareAlike License (CC BY-SA). This means that content may be reused with appropriate attribution and shared under a similar license.
  5. Responsible use. Any risk arising from the use of information from this website is entirely the responsibility of the user.