AI Ops Engineer (m/w/d)

Unternehmen: Insight42
Standort: Remote (innerhalb Deutschlands)
Beschäftigungsart: Vollzeit

Über Insight42
Insight42 ist ein wegweisendes Daten- und KI-Technologieunternehmen, das sich auf den Aufbau intelligenter Automatisierungs-Frameworks, sicherer KI-Infrastruktur und Datenplattformen für digitale Produkte der nächsten Generation konzentriert. Unsere Mission ist es, Cloud-Engineering, MLOps und generative KI-Fähigkeiten zu resilienten, skalierbaren und effizienten Systemen zu verschmelzen.

Rollenüberblick
Wir suchen einen erfahrenen AI Ops Engineer (m/w/d), der die Infrastruktur konzipiert und betreibt, die die GenAI- und Large-Language-Model-(LLM)-Workloads von Insight42 antreibt. Die Rolle umfasst die Architektur selbstgehosteter GenAI-Umgebungen, die Optimierung der GPU-/CPU-Orchestrierung und die Automatisierung des Modell-Deployments über Edge- und Cloud-Systeme hinweg.

Aufgaben

  • Selbstgehostete GenAI-Modell-Deployments in sicheren Cloud-Umgebungen konzipieren und pflegen
  • Workflows für das Lifecycle-Management von KI-Modellen aufbauen und automatisieren (Training, Tuning und Versionierung)
  • Observability- und Reliability-Lösungen für KI-Workloads implementieren
  • Mit MLOps-, DevOps- und Datenteams zusammenarbeiten, um die Infrastruktur an den Modellanforderungen auszurichten
  • Modelle in agentische Frameworks und Ökosysteme autonomer Systeme integrieren
  • Infrastruktur für Performance, Kosteneffizienz und Skalierbarkeit optimieren
  • CI/CD- und GitOps-Praktiken für die Auslieferung von KI- und ML-Systemen etablieren

Anforderungen

  • 4+ Jahre Erfahrung in DevOps, MLOps oder KI-Infrastruktur-Engineering
  • Praktische Erfahrung im Deployment selbstgehosteter GenAI-Modelle (LLMs, multimodale oder Diffusionsmodelle)
  • Fundiertes Verständnis von Containerisierung, Microservices und Orchestrierung (Docker, Kubernetes)
  • Vertrautheit mit agentischen Ökosystemen, KI-Orchestrierungs-Frameworks und Vektordatenbanken
  • Kenntnisse in GPU-Orchestrierung, verteilter Inferenz oder On-Prem-KI-Serving-Lösungen
  • Solide Programmier- und Automatisierungskenntnisse (Python, Bash oder Go)
  • Cloud-Erfahrung mit Azure, GCP oder Hybrid-Infrastruktur-Setups
  • Sichere Kommunikation in Englisch; Deutsch ist ein Plus

Wünschenswert

  • Erfahrung mit Open-Source-KI-Frameworks (Ollama, vLLM, FastAPI, LangChain, Haystack)
  • Verständnis von KI-Observability- und Monitoring-Tools
  • Erfahrung mit Modellkompression, Quantisierung und Inferenzoptimierung
  • Bewusstsein für Datenschutz, Sicherheit und Compliance in KI-Systemen

Was wir bieten

  • Vollständige Remote-Flexibilität (innerhalb Deutschlands)
  • Wettbewerbsfähiges Gehalt und leistungsbezogene Anreize
  • Die Möglichkeit, KI-Infrastruktur im großen Maßstab aufzubauen und zu betreiben
  • Eine kollaborative, vorausdenkende Arbeitskultur, getrieben von Innovation
Jetzt bewerben