So funktioniert es
Aleph besteht aus drei Teilen:
Satelliten
Die Geräte, mit denen du sprichst: ein Desktop-Overlay, ein Android-Kiosk auf einem Wandtablet, dein Handy oder ein ESP32-Board mit Mikrofon und Lautsprecher. Satelliten streamen Audio über das Alabama-Protokoll zum Server.
Der Server
Die aleph-Binary. Er routet Audio, verwaltet Satelliten, hostet das Web UI und überwacht die ML-Pipeline.
Die ML-Pipeline (Sidecar)
Ein Unterprozess, den der Server startet und verwaltet. Er führt Spracherkennung, das Sprachmodell und Sprachsynthese auf deiner GPU aus. Du interagierst nie direkt damit.
Ein Sprach-Turn von Anfang bis Ende
- Ein Satellit erkennt das Wakeword und beginnt, deine Stimme zu streamen.
- Der Server leitet Audio an die Pipeline weiter; Spracherkennung erzeugt ein Live-Transkript.
- Ein Turn-Detektor erkennt, wenn du fertig gesprochen hast.
- Das LLM antwortet — dabei können auch Tools aufgerufen werden.
- Sprachsynthese streamt die gesprochene Antwort zurück zum Satelliten.