Deutsches Wake Word für Home Assistant – lokal über Wyoming

Hallo zusammen,

ich entwickle derzeit eine lokale Wake-Word-Lösung für Home Assistant. Mein Ausgangsproblem: Für englische Wake Words gibt es gute fertige Modelle, bei einem eigenen deutschen Ausdruck wird es aber schnell aufwendig. Man braucht Trainingsdaten, eine passende Umgebung und muss das Modell anschließend noch in Home Assistant integrieren.

Mein Ziel war deshalb ein möglichst einfacher Ablauf:

1. Ein deutsches Wake Word eingeben, zum Beispiel „Hallo Lampe“.

2. Ein kompaktes ONNX-Modell erzeugen lassen.

3. Das Modell lokal über das Wyoming-Protokoll mit Home Assistant verbinden.

4. Falls eine Aussprache nicht zuverlässig erkannt wird, ungefähr fünf echte Sprachaufnahmen ergänzen und erneut trainieren.

Das Projekt heißt **Voicute** und unterstützt aktuell Deutsch, Französisch, Japanisch, Chinesisch und Englisch. Die Erkennung läuft nach der Modellerstellung vollständig lokal; während der Nutzung wird kein Audiosignal an einen Cloud-Spracherkennungsdienst übertragen.

## Einbindung in Home Assistant

Die Open-Source-Laufzeit enthält einen Wyoming-Dienst sowie eine Docker- und Add-on-Konfiguration. In Home Assistant wird der laufende Dienst über folgenden Weg hinzugefügt:

**Einstellungen → Geräte & Dienste → Integration hinzufügen → Wyoming Protocol**

Anschließend lässt sich das Wake Word in der Konfiguration des Sprachassistenten auswählen. Die ausführliche Installation und Beispielmodelle liegen im öffentlichen Repository, das ich unten verlinkt habe.

## Aktueller technischer Stand

- Standardformat ONNX, keine proprietäre Modelldatei

- Modellgröße ungefähr 128 KB in FP32 beziehungsweise 74 KB in INT8

- Gemessene Inferenzzeit unter 5 ms pro Frame auf einem Desktop-System

- Unter 10 ms pro Frame auf einem ESP32-S3

- Laufzeiten für Python, Android, ESP32, Web und Home Assistant/Wyoming

- Ein oder mehrere Schlüsselwörter in einem Modell

- Optional zuschaltbare Filter gegen Fehlauslösungen

Für die veröffentlichten Demo-Keywords liegen Tests mit zurückgehaltenen synthetischen Stimmen vor. Die gemessene Trefferquote liegt je nach Keyword zwischen 90,3 und 100 Prozent. Das deutsche Demo-Keyword „Apfelstrudel“ erreichte dabei 99,4 Prozent.

Diese Werte sind kein Ersatz für Tests mit echten Mikrofonen, Dialekten, Raumakustik und Hintergrundgeräuschen. Genau dafür suche ich jetzt Rückmeldungen aus der Community.

Mich würde besonders interessieren:

- Welche deutschen Wake Words würdet ihr tatsächlich zu Hause verwenden?

- Auf welcher Home-Assistant-Hardware sollte ich die Installation zusätzlich testen?

- Gibt es Interesse an einem vollständigen deutschen Wyoming-Tutorial?

- Welche Dialekte oder Stimmen sollten in einem Praxistest vorkommen?

Modellerstellung: https://www.voicute.com

Open-Source-Laufzeit, Wyoming-Anleitung, Benchmarks und Demo-Modelle: GitHub - voicute/onnx-wakeword: Offline keyword spotting & wake word engine. ONNX format, model <130KB, inference <10ms. Runs on Android, ESP32, Linux, Web. No cloud, no data usage. · GitHub

**Hinweis zur Transparenz:** Ich bin der Entwickler von Voicute. Die Modellerstellung ist ein kommerzieller Dienst; die Inferenz-Engine und die Home-Assistant-Anbindung sind Open Source. Ich freue mich über kritisches Feedback, insbesondere zu deutschen Wake Words und zur Wyoming-Installation.

4 „Gefällt mir“

Cool. Danke für deine Arbeit und Willkommen im Forum. @Thorsten-Voice das wäre doch was für dich.

Grüß dich und willkommen in dieser Gemeinschaft. :+1: :waving_hand:

Von mir auch ein Herzliches Willkommen bei uns.

1 „Gefällt mir“

Interessantes Projekt! Wie funktioniert das genau? Auf der Webseite wird beschrieben, dass alles lokal und on-device verarbeitet wird, aber gleichzeitig 0 GPU benötigt wird? Wird das Model nun auf dem eigenen Gerät oder bei dir in der Cloud trainiert?
Und kommst du aus China oder warum ist die Compliance Section rein chinesisch?

1 „Gefällt mir“