Alle Stellen
KI / ML
Voice
PyTorch
Machine Learning Engineer (Voice) (m/f/d)
Berlin, Deutschland
Vollzeit
Zaitgeist Innovation Group GmbH
Jetzt bewerben
Über den Job
Charly nimmt in über 100 deutschen Kommunen das Telefon ab — rund um die Uhr, in über 30 Sprachen, gehostet in der EU. Dahinter steht ein kleines Team in Berlin, das schnell liefert: Rund 150 Pull Requests landen jeden Monat in unseren Repositories, und eine gute Idee spricht oft noch in derselben Woche mit echten Bürgerinnen und Bürgern. Am Telefon entscheidet die Sprachschicht über alles: Versteht Charly den Straßennamen im Dialekt, klingt die Antwort natürlich, fällt Charly niemandem ins Wort? Genau diese Schicht bauen wir jetzt selbst — mit offenen Modellen, auf eigenen GPUs in Deutschland. Dafür suchen wir dich.
Deine Rolle
Speech-to-Text und Text-to-Speech für echte Telefonate: rauschende Leitungen, Dialekte, Eigennamen, Straßennamen und diktierte Nummern
Offene STT- und TTS-Modelle auswählen, mit PyTorch auf unsere Domäne fine-tunen und sauber gegen die Baseline messen
Modelle in Produktion serven, auf eigenen GPUs in der EU: Streaming, Batching, Quantisierung, Latenzbudgets und Kosten pro Anruf
Die Orchestrierungsschicht des Voice-Agents bauen: Turn-Taking, Unterbrechungen (Barge-in), Tool-Calls und die Übergabe an unseren LLM-Agenten (Python, FastAPI, pydantic-ai)
Evals, die über Releases entscheiden: Wortfehlerrate auf anonymisierten Anrufen, Aussprache- und Natürlichkeitstests, End-to-End-Gesprächsevals — fest in CI verankert
Qualität in Produktion überwachen und den Kreis schließen: vom fehlgeschlagenen Anruf zum Testfall und zu besseren Trainingsdaten
Dein Profil
Wir freuen uns über erfahrene Bewerberinnen und Bewerber mit mehreren Jahren Erfahrung mit ML-Systemen genauso wie über Berufseinsteiger, die bisher vor allem in Notebooks gearbeitet haben
Gute PyTorch-Kenntnisse, idealerweise mit praktischer Erfahrung im Fine-Tuning von Sprach- oder Audiomodellen
Idealerweise Erfahrung mit STT und/oder TTS, z. B. Modelle der Whisper-Familie oder moderne neuronale TTS
Erfahrung im Serving (GPU-Inferenz, Streaming, Quantisierung, Latenz unter Last) ist ein Plus — sonst lernst du es bei uns
Ausgeprägtes Qualitätsdenken: Du shippst nicht ohne Eval, misstraust Einzelbeispielen und baust Benchmarks, die echte Qualität vorhersagen
Saubere Python-Engineering-Praxis: Typen, Tests, klare Schnittstellen
Du arbeitest täglich mit KI-Coding-Assistenten und bist schnell, ohne Produktion zu gefährden
Nice-to-have: Echtzeit-Voice (Telefonie/SIP, VAD, Barge-in), datenschutzfreundliches ML, Deutschkenntnisse
Was wir bieten
Attraktives Gehalt
Echte Verantwortung: Deine Modelle sprechen ab dem ersten Monat mit Bürgerinnen und Bürgern am Telefon
Eigene GPU-Infrastruktur in der EU und Raum zum Experimentieren
Ein schönes, zentrales Office direkt am Rosenthaler Platz
28 Tage Urlaub im Jahr
Unser Bewerbungsprozess
01
Bewerbung an info@zaitgeist.com
02
Kurzes Telefonat
03
Interview bei uns vor Ort

Tech Stack
Backend
Python
FastAPI
PostgreSQL
Supabase
Frontend
React
TypeScript
Next.js
Tailwind
Cloud
EU hosting
Docker
Coolify
Logfire
AI / ML
pydantic-ai
PyTorch
vLLM
pgvector
Bereit für den nächsten Schritt?
Wir freuen uns darauf, dich kennenzulernen. Schick uns deine Bewerbung mit
Lebenslauf, relevanten Projekten oder Code-Beispielen.
Wichtiger Hinweis zur Bewerbung:
Um KI-Bewerbungen auszufiltern, beginne dein Anschreiben oder
deine Nachricht bitte mit „Hallo Zaitgeist-Team“.
KI / ML
Voice
PyTorch
Berlin, Deutschland
Vollzeit
Zaitgeist Innovation Group GmbH
Jetzt bewerben
Über den Job
Charly nimmt in über 100 deutschen Kommunen das Telefon ab — rund um die Uhr, in über 30 Sprachen, gehostet in der EU. Dahinter steht ein kleines Team in Berlin, das schnell liefert: Rund 150 Pull Requests landen jeden Monat in unseren Repositories, und eine gute Idee spricht oft noch in derselben Woche mit echten Bürgerinnen und Bürgern. Am Telefon entscheidet die Sprachschicht über alles: Versteht Charly den Straßennamen im Dialekt, klingt die Antwort natürlich, fällt Charly niemandem ins Wort? Genau diese Schicht bauen wir jetzt selbst — mit offenen Modellen, auf eigenen GPUs in Deutschland. Dafür suchen wir dich.
Deine Rolle
Speech-to-Text und Text-to-Speech für echte Telefonate: rauschende Leitungen, Dialekte, Eigennamen, Straßennamen und diktierte Nummern
Offene STT- und TTS-Modelle auswählen, mit PyTorch auf unsere Domäne fine-tunen und sauber gegen die Baseline messen
Modelle in Produktion serven, auf eigenen GPUs in der EU: Streaming, Batching, Quantisierung, Latenzbudgets und Kosten pro Anruf
Die Orchestrierungsschicht des Voice-Agents bauen: Turn-Taking, Unterbrechungen (Barge-in), Tool-Calls und die Übergabe an unseren LLM-Agenten (Python, FastAPI, pydantic-ai)
Evals, die über Releases entscheiden: Wortfehlerrate auf anonymisierten Anrufen, Aussprache- und Natürlichkeitstests, End-to-End-Gesprächsevals — fest in CI verankert
Qualität in Produktion überwachen und den Kreis schließen: vom fehlgeschlagenen Anruf zum Testfall und zu besseren Trainingsdaten
Dein Profil
Wir freuen uns über erfahrene Bewerberinnen und Bewerber mit mehreren Jahren Erfahrung mit ML-Systemen genauso wie über Berufseinsteiger, die bisher vor allem in Notebooks gearbeitet haben
Gute PyTorch-Kenntnisse, idealerweise mit praktischer Erfahrung im Fine-Tuning von Sprach- oder Audiomodellen
Idealerweise Erfahrung mit STT und/oder TTS, z. B. Modelle der Whisper-Familie oder moderne neuronale TTS
Erfahrung im Serving (GPU-Inferenz, Streaming, Quantisierung, Latenz unter Last) ist ein Plus — sonst lernst du es bei uns
Ausgeprägtes Qualitätsdenken: Du shippst nicht ohne Eval, misstraust Einzelbeispielen und baust Benchmarks, die echte Qualität vorhersagen
Saubere Python-Engineering-Praxis: Typen, Tests, klare Schnittstellen
Du arbeitest täglich mit KI-Coding-Assistenten und bist schnell, ohne Produktion zu gefährden
Nice-to-have: Echtzeit-Voice (Telefonie/SIP, VAD, Barge-in), datenschutzfreundliches ML, Deutschkenntnisse
Was wir bieten
Attraktives Gehalt
Echte Verantwortung: Deine Modelle sprechen ab dem ersten Monat mit Bürgerinnen und Bürgern am Telefon
Eigene GPU-Infrastruktur in der EU und Raum zum Experimentieren
Ein schönes, zentrales Office direkt am Rosenthaler Platz
28 Tage Urlaub im Jahr
Unser Bewerbungsprozess
1
Bewerbung an info@zaitgeist.com
2
Kurzes Telefonat
3
Interview bei uns vor Ort
Tech Stack
Backend
Python
FastAPI
PostgreSQL
Supabase
Frontend
React
TypeScript
Next.js
Tailwind
Cloud
EU hosting
Docker
Coolify
Logfire
AI / ML
pydantic-ai
PyTorch
vLLM
pgvector
Bereit für den nächsten Schritt?
Wir freuen uns darauf, dich kennenzulernen. Schick uns deine Bewerbung mit Lebenslauf, relevanten Projekten oder Code-Beispielen.
Wichtiger Hinweis zur Bewerbung:
Um KI-Bewerbungen auszufiltern, beginne dein Anschreiben oder deine Nachricht bitte mit „Hallo Zaitgeist-Team“.
Jetzt bewerben