Künstliche Intelligenz in modernen hörsystemen

Von Sven Kreher (Phonak) Abbildungen: Phonak

Hörverlust zählt weltweit zu den häufigsten chronischen Gesundheitseinschränk-ungen und betrifft Menschen aller Altersgruppen, mit steigender Prävalenz im höheren Lebensalter. Die Folgen eines unversorgten Hörverlusts beschränken sich dabei keineswegs auf die rein akustische Wahrnehmung. Kommunikationsprobleme, soziale Isolation, emotionale Belastung und berufliche Einschränkungen sind typische Begleiterscheinungen, die die Lebensqualität der Betroffenen und ihres sozialen Umfelds erheblich mindern.

Einleitung

Moderne Hörsysteme haben in den vergangenen Jahren einen tiefgreifenden technologischen Wandel vollzogen. Insbesondere der Einsatz künstlicher Intelligenz (KI) in der Signalverarbeitung hat die Leistungsfähigkeit von Hörsystemen grundlegend verändert. Dabei ist KI bei Hörsystemen kein einzelnes Feature, sondern eine Frage von Struktur, Einbindung und Nutzen. Grob unterteilen lassen sich einfache Situationsklassifikation bis hin zu direkten, DNN-basierten Audiosignalverarbeitungen. Der entscheidende Unterschied liegt darin, ob KI lediglich bestehende Algorithmen steuert oder ob sie unmittelbar an der Verarbeitung des Audiosignals beteiligt ist.

Anzeige

GEERS-Anzeige-September-2026

Technologischer Hintergrund: KI im Phonak Audéo Sphere Infinio

Von der Klassifikation zur Signalverarbeitung

Um den technologischen Stellenwert des Phonak Audéo Sphere Infinio einordnen zu können, ist eine Differenzierung der verschiedenen KI-Einsatzebenen in Hörsystemen notwendig. Grundsätzlich lassen sich zwei Hauptkategorien unterscheiden:

Klassifikationsbasierte KI erkennt die akustische Umgebung (z. B. »Straßenlärm«, »Restaurant«, »ruhiges Gespräch«) und steuert auf dieser Grundlage vorprogrammierte Verstärkungs- und Filteralgorithmen. Die KI trifft hier eine Entscheidung über die Programm- und Featurewahl, greift aber nicht direkt in die Audiosignalverarbeitung ein.

DNN-basierte Signalverarbeitung geht einen entscheidenden Schritt weiter: Ein tiefes neuronales Netz (Deep Neural Network, DNN) ist direkt in die Verarbeitungskette des Audiosignals integriert und trennt Sprache von Störgeräuschen anhand erlernter akustischer Muster und nicht anhand vorher definierter Regeln. Dies ermöglicht eine deutlich differenziertere und situationsunabhängigere Verarbeitung, insbesondere in komplexen und unbekannten akustischen Umgebungen.

Während klassische, regelbasierte Signalverarbeitung auf vorab definierten Parametern basiert, nutzen Deep Neural Networks statistisch erlernte Zusammenhänge aus sehr großen Datenmengen. Das System erkennt dabei nicht einzelne Geräusche anhand fester Regeln, sondern analysiert komplexe Muster innerhalb des Audiosignals. Dadurch kann es auch in Situationen reagieren, die während der Entwicklung nicht explizit programmiert wurden. Besonders in dynamischen Hörumgebungen mit wechselnden Schallquellen, mehreren Gesprächspartnern und konkurrierenden Hintergrundgeräuschen eröffnet dieser Ansatz neue Möglichkeiten für die Verbesserung des Sprachverstehens.

Die Entwicklung solcher neuronaler Netze ist eng mit Fortschritten in der Rechenleistung verbunden. Während frühere Hörsysteme aufgrund begrenzter Prozessorkapazitäten lediglich vereinfachte KI-Funktionen nutzen konnten, ermöglichen moderne Chiparchitekturen erstmals die lokale Verarbeitung komplexer DNN-Modelle direkt im Hörsystem. Dies reduziert die Abhängigkeit von Cloud-Diensten oder externen Geräten und erlaubt eine Echtzeitverarbeitung ohne wahrnehmbare Verzögerung.

Phonak_KI_Abb_1_Überbick-KI

Die DEEPSONIC-Architektur des Phonak Audéo Sphere Infinio

Das Phonak Audéo Sphere Infinio setzt mit seiner DEEPSONIC-Architektur auf einen dedizierten DNN-Prozessor, der ausschließlich für die Aufgabe der Sprach- und Geräuschtrennung optimiert ist. Das zugrundeliegende neuronale Netz wurde auf Millionen von Soundbeispielen trainiert und ist damit in der Lage, komplexe akustische Muster zu erkennen und zu verarbeiten, die regelbasierten Systeme nicht erfassen können.

Der Einsatz eines dedizierten KI-Prozessors, im Gegensatz zur Ausführung eines neuronalen Netzes auf einem bereits vorhandenen Signalprozessor – bietet dabei entscheidende Vorteile:

• Größere und komplexere Modelle können eingesetzt werden, ohne andere Verarbei- tungsprozesse zu beeinträchtigen.

• Gezielte Optimierung der Hardware für neuronale Netzoperationen ermöglicht

höhere Effizienz bei geringerem

Energieverbrauch.

• Niedrige Latenz in der Signalverarbeitung wird gewährleistet, da keine Konkurrenz mit anderen Prozessen besteht – ein kriti- scher Faktor, da eine wahrnehmbare Ver- zögerung zwischen direktem und verstärktem

Schall die Hörqualität erheblich beeinträch- tigen würde.

DEEPSONIC wurde mit mehr als 22 Millionen Klangbeispielen trainiert und verarbeitet bis zu 7,7 Milliarden Operationen pro Sekunde. Das Ziel besteht nicht darin, einzelne Geräusche lediglich zu unterdrücken, sondern Sprache in komplexen akustischen Umgebungen gezielt von konkurrierenden Störquellen zu trennen. Dadurch soll ein deutlich günstigeres Signal-Rausch-Verhältnis entstehen, das für Menschen mit Hörverlust einer der wichtigsten Einflussfaktoren für Sprachverständlichkeit ist.

Aus audiologischer Sicht ist dies besonders relevant, da Menschen mit Hörverlust selbst bei optimaler Verstärkung häufig ein besseres Signal-Rausch-Verhältnis benötigen als Normalhörende, um dieselbe Sprachverständlichkeit zu erreichen. Die eigentliche Herausforderung moderner Hörsysteme besteht daher nicht primär in der Lautstärkeanhebung, sondern in der zuverlässigen Separierung sprachlicher Informationen von störenden Schallanteilen.

Chancen und Grenzen KI-basierter Signalverarbeitung

Auch KI-basierte Signalverarbeitung ist kein universeller Problemlöser. Wenn ein System algorithmisch entscheidet, welche Signalanteile relevant sind, besteht grundsätzlich das Risiko von Fehlentscheidungen. Ein DNN kann unter Umständen einen relevanten Sprecher teilweise unterdrücken, einen Störsprecher als Zielsprecher interpretieren oder bei unbekannten akustischen Situationen suboptimal reagieren. Darüber hinaus gilt der Grundsatz:

Mehr Geräuschreduktion entspricht nicht automatisch besserem Hören.

Eine zu aggressive Verarbeitung kann zwar Störgeräusche reduzieren, gleichzeitig aber Klangqualität, Natürlichkeit oder räumliche Wahrnehmung beeinträchtigen. Die optimale Verarbeitung ist daher stets ein Kompromiss zwischen Sprachverständlichkeit, Klangqualität, Natürlichkeit, räumlicher Information und Hörkomfort.

Für eine objektive Bewertung eines KI-Hörsystems empfiehlt sich daher ein Bewertungsmodell entlang von fünf Ebenen:

Dieses Schema verhindert, dass allein die Bezeichnung »KI« zum Qualitätsmerkmal wird und kann die Einordnung verschiedener KI-Ansätze erleichtern.

Einordnung von KI-Systemen in der Hörakustik

Die Bewertung von KI-basierten Hörsystemen stellt Forschung und Praxis vor besondere Herausforderungen. Während technische Kennzahlen wie Rechenleistung, Anzahl neuronaler Verbindungen oder Trainingsdatenmengen Hinweise auf die Leistungsfähigkeit liefern, erlauben sie allein keine Aussage über den tatsächlichen Nutzen für Betroffene. Entscheidend bleibt die Frage, ob technische Verbesserungen zu einem messbaren Mehrwert im Alltag führen.

Deshalb werden moderne Hörsysteme zunehmend anhand mehrerer Endpunkte bewertet. Neben der klassischen Sprachverständlichkeit gewinnen Parameter wie Höranstrengung (Listening Effort), subjektive Hörqualität, Trageakzeptanz, soziale Teilhabe sowie die wahrgenommene Lebensqualität an Bedeutung. Zahlreiche Studien zeigen, dass eine Verringerung der Höranstrengung für Betroffene oftmals einen ebenso hohen Stellenwert besitzt wie eine Verbesserung der Worterkennungsrate.

Gerade die Höranstrengung wird heute als wichtiger Faktor für kognitive Belastung und Ermüdung betrachtet. Personen mit Hörverlust berichten häufig, dass sie Gesprächen zwar grundsätzlich folgen können, dies jedoch mit erheblichem mentalen Aufwand verbunden ist. Moderne KI-Systeme verfolgen daher nicht ausschließlich das Ziel eines besseren Verstehens, sondern auch die Reduktion dieser kognitiven Belastung.

Phonak_KI_Abb

DEEPSONIC-Chip für den dezidierten DNN-Prozessor

Bedeutung für die zukünftige Entwicklung von Hörsystemen

Das Nutzen leistungsstarker Künstlicher Intelligenz markiert einen Paradigmenwechsel in der Hörsystemtechnologie. Während frühere Entwicklungsstufen vor allem auf verbesserte Mikrofone, ausgefeiltere Richtcharakteristiken oder leistungsfähigere klassische Signalprozessoren setzten, rückt nun die datenbasierte Interpretation akustischer Umgebungen und direkter Anwendung auf das Audiosignal in den Mittelpunkt.

Langfristig könnten neuronale Netze nicht nur Sprache von Störgeräuschen trennen, sondern auch individuelle Hörpräferenzen erlernen, Hörsituationen vorhersagen und die Signalverarbeitung noch stärker personalisieren. Gleichzeitig steigen jedoch die Anforderungen an Transparenz, Validierung und klinische Evidenz. Die Bezeichnung »KI« allein stellt keinen Qualitätsnachweis dar. Entscheidend bleiben die Struktur, Einbindung und der wissenschaftlich belegte Nutzen für die Anwenderinnen und Anwender.