Skip to content

So funktioniert es

Aleph besteht aus drei Teilen:

Satelliten

Die Geräte, mit denen du sprichst: ein Desktop-Overlay, ein Android-Kiosk auf einem Wandtablet, dein Handy oder ein ESP32-Board mit Mikrofon und Lautsprecher. Satelliten streamen Audio über das Alabama-Protokoll zum Server.

Der Server

Die aleph-Binary. Er routet Audio, verwaltet Satelliten, hostet das Web UI und überwacht die ML-Pipeline.

Die ML-Pipeline (Sidecar)

Ein Unterprozess, den der Server startet und verwaltet. Er führt Spracherkennung, das Sprachmodell und Sprachsynthese auf deiner GPU aus. Du interagierst nie direkt damit.

Ein Sprach-Turn von Anfang bis Ende

  1. Ein Satellit erkennt das Wakeword und beginnt, deine Stimme zu streamen.
  2. Der Server leitet Audio an die Pipeline weiter; Spracherkennung erzeugt ein Live-Transkript.
  3. Ein Turn-Detektor erkennt, wenn du fertig gesprochen hast.
  4. Das LLM antwortet — dabei können auch Tools aufgerufen werden.
  5. Sprachsynthese streamt die gesprochene Antwort zurück zum Satelliten.