← Karriere bei Charly

KI / ML

Voice

PyTorch

Machine Learning Engineer (Voice) (m/f/d)

Berlin, Deutschland

Vollzeit

Zaitgeist Innovation Group GmbH

Jetzt bewerben

Über den Job

Charly nimmt in über 100 deutschen Kommunen das Telefon ab — rund um die Uhr, in über 30 Sprachen, gehostet in der EU. Dahinter steht ein kleines Team in Berlin, das schnell liefert: Rund 150 Pull Requests landen jeden Monat in unseren Repositories, und eine gute Idee spricht oft noch in derselben Woche mit echten Bürgerinnen und Bürgern. Am Telefon entscheidet die Sprachschicht über alles: Versteht Charly den Straßennamen im Dialekt, klingt die Antwort natürlich, fällt Charly niemandem ins Wort? Genau diese Schicht bauen wir jetzt selbst — mit offenen Modellen, auf eigenen GPUs in Deutschland. Dafür suchen wir dich.

Deine Rolle

Speech-to-Text und Text-to-Speech für echte Telefonate: rauschende Leitungen, Dialekte, Eigennamen, Straßennamen und diktierte Nummern

Offene STT- und TTS-Modelle auswählen, mit PyTorch auf unsere Domäne fine-tunen und sauber gegen die Baseline messen

Modelle in Produktion serven, auf eigenen GPUs in der EU: Streaming, Batching, Quantisierung, Latenzbudgets und Kosten pro Anruf

Die Orchestrierungsschicht des Voice-Agents bauen: Turn-Taking, Unterbrechungen (Barge-in), Tool-Calls und die Übergabe an unseren LLM-Agenten (Python, FastAPI, pydantic-ai)

Evals, die über Releases entscheiden: Wortfehlerrate auf anonymisierten Anrufen, Aussprache- und Natürlichkeitstests, End-to-End-Gesprächsevals — fest in CI verankert

Qualität in Produktion überwachen und den Kreis schließen: vom fehlgeschlagenen Anruf zum Testfall und zu besseren Trainingsdaten

Dein Profil

Wir freuen uns über erfahrene Bewerberinnen und Bewerber mit mehreren Jahren Erfahrung mit ML-Systemen genauso wie über Berufseinsteiger, die bisher vor allem in Notebooks gearbeitet haben

Gute PyTorch-Kenntnisse, idealerweise mit praktischer Erfahrung im Fine-Tuning von Sprach- oder Audiomodellen

Idealerweise Erfahrung mit STT und/oder TTS, z. B. Modelle der Whisper-Familie oder moderne neuronale TTS

Erfahrung im Serving (GPU-Inferenz, Streaming, Quantisierung, Latenz unter Last) ist ein Plus — sonst lernst du es bei uns

Ausgeprägtes Qualitätsdenken: Du shippst nicht ohne Eval, misstraust Einzelbeispielen und baust Benchmarks, die echte Qualität vorhersagen

Saubere Python-Engineering-Praxis: Typen, Tests, klare Schnittstellen

Du arbeitest täglich mit KI-Coding-Assistenten und bist schnell, ohne Produktion zu gefährden

Nice-to-have: Echtzeit-Voice (Telefonie/SIP, VAD, Barge-in), datenschutzfreundliches ML, Deutschkenntnisse

Was wir bieten

Attraktives Gehalt

Echte Verantwortung: Deine Modelle sprechen ab dem ersten Monat mit Bürgerinnen und Bürgern am Telefon

Eigene GPU-Infrastruktur in der EU und Raum zum Experimentieren

Ein schönes, zentrales Office direkt am Rosenthaler Platz

28 Tage Urlaub im Jahr

Unser Bewerbungsprozess

1

Bewerbung an info@zaitgeist.com

2

Kurzes Telefonat

3

Interview bei uns vor Ort

Tech Stack

Backend

Python

FastAPI

PostgreSQL

Supabase

Frontend

React

TypeScript

Next.js

Tailwind

Cloud

EU hosting

Docker

Coolify

Logfire

AI / ML

pydantic-ai

PyTorch

vLLM

pgvector

Bereit für den nächsten Schritt?

Wir freuen uns darauf, dich kennenzulernen. Schick uns deine Bewerbung mit Lebenslauf, relevanten Projekten oder Code-Beispielen.

Wichtiger Hinweis zur Bewerbung:

Um KI-Bewerbungen auszufiltern, beginne dein Anschreiben oder deine Nachricht bitte mit „Hallo Zaitgeist-Team“.

Jetzt bewerben

Machine Learning Engineer (Voice) (m/f/d) | Charly