ML/AIWork

Expert kubernetes /ia (h/f) : kubernetes, prometheus

gamme solutions · Paris, FR

Job description

EXPERT KUBERNETES / IA (H/F)Contexte de la missionNous recherchons pour le compte de notre client un(e) Expert(e) Kubernetes / IA pour assurer l?exploitation, la disponibilité, la performance et la stabilité d?un cluster IA reposant sur des infrastructures GPU/CPU, réseau et stockage.

Le profil recherché devra également contribuer à l?automatisation de l?exploitation, au traitement des incidents et à l?amélioration continue de l?infrastructure.

Missions principales Maintien en condition opérationnelle ? MCO

Garantir la disponibilité, la performance et la stabilité du cluster IA.

Administrer les n?uds GPU/CPU, les infrastructures de stockage et les composants réseau.

Assurer le suivi et l?optimisation des ressources de l?infrastructure.

Piloter les opérations de maintenance et les mises à jour techniques.

Administration Linux

Installer, configurer et administrer les environnements Linux Ubuntu.

Réaliser les opérations d?optimisation et de troubleshooting.

Administrer et mettre à jour les pilotes NVIDIA, CUDA et composants associés.

Kubernetes

Administrer et exploiter les environnements Kubernetes.

Réaliser les déploiements, le scaling et la gestion de la haute disponibilité (HA).

Assurer le maintien en conditions opérationnelles des clusters.

Piloter les mises à jour des composants Kubernetes.

Gérer les problématiques liées aux ressources et à la capacité des clusters.

Supervision et observabilité

Mettre en place et maintenir la supervision des infrastructures.

Exploiter Prometheus et Grafana pour le monitoring et l?analyse des performances.

Identifier les anomalies et anticiper les incidents grâce à une approche proactive.

Automatisation

Automatiser les tâches d?administration et d?exploitation avec Ansible.

Développer et maintenir des scripts Bash et Python.

Optimiser les processus opérationnels afin de réduire les tâches manuelles.

Gestion des jobs IA / GPU

Assurer l?ordonnancement des tâches et jobs GPU.

Gérer les quotas, priorités et ressources GPU.

Optimiser l?allocation des ressources CPU/GPU.

Gestion des incidents

Prendre en charge les incidents techniques complexes.

Réaliser les analyses de causes racines et les post-mortems.

Définir et suivre les plans d?actions correctifs.

Coordonner les interventions avec les différentes équipes techniques.

Documentation

Rédiger et maintenir la documentation d?exploitation.

Formaliser les procédures techniques et les consignes de maintenance.

Garantir la traçabilité et la continuité des opérations.

Profil candidat:

Profil recherchéMinimum 8 ans d?expérience professionnelle sur des environnements similaires.

Certification Kubernetes obligatoire.

Expertise en administration Linux Ubuntu.

Très bonne maîtrise de Kubernetes et Docker.

Expérience concrète sur les infrastructures GPU NVIDIA : drivers, CUDA, MIG.

Maîtrise d?Ansible.

Bon niveau en scripting Bash et/ou Python.

Expérience des environnements distribués.

ML/AI Work links you to the employer's original posting — always verify the details there before applying.

More Machine Learning roles

View all →
Expert kubernetes /ia (h/f) : kubernetes, prometheus
gamme solutions
Apply →