NANTES, FR, 44000 ROUBAIX, FR, 59100 LYON, FR, 69003 ROUBAIX, FR, 59100 ROUBAIX, FR, 59100 ROUBAIX, FR, 59100 TOULOUSE, FR, 31000
SRE Managed Kubernetes H/F/N
Au sein de votre équipe #OneTeam
- Intégrer la Product Unit Public Cloud, au sein de l'équipe en charge de la conception, de l'évolution et de l'exploitation de l'offre Kubernetes managé.
- Développer et opérer une plateforme Kubernetes utilisée par un grand nombre de clients, reposant sur des infrastructures distribuées complexes. La fiabilité, la performance, la disponibilité, la sécurité et l'évolutivité sont des enjeux structurants de cette plateforme.
- En tant que Site Reliability Engineer expérimenté, intervenir au cœur du fonctionnement de la plateforme Kubernetes (control plane, controllers, reconciliation loops, API server, etcd) afin de garantir la stabilité et l'évolutivité du produit.
- Contribuer à l'industrialisation, à l'automatisation et à l'amélioration continue des mécanismes de fiabilité. Après une période de formation et de montée en compétence, intégrer la rotation d'astreinte de l'équipe afin d'assurer la continuité de service à nos clients.
- Au sein d'OVHcloud, adopter une approche de développement augmentée par l'IA, où l'IA générative est intégrée aux pratiques quotidiennes : conception, développement, tests, revue de code et documentation.
Vos principales responsabilités
- Garantir la disponibilité, la performance et la résilience de la plateforme haute disponibilité
- Concevoir, faire évoluer et maintenir des architectures distribuées robustes, scalables et sécurisées
- Développer des mécanismes d'automatisation, de supervision et d'auto-remédiation (Infrastructure as Code, scripts, controllers Kubernetes)
- Définir et faire évoluer les pratiques de supervision, d'observabilité et d'AIOps (métriques, logs, alerting, tracing distribué, détection d'anomalies, corrélation d'événements et analyse prédictive)
- Participer aux analyses d'incidents majeurs, implémenter les actions correctives durables et exploiter les capacités de l'IA pour accélérer l'identification des causes racines, la résolution des incidents et l'amélioration continue de la fiabilité du produit
Votre futur impact
Dans 6 mois
-
Vous aurez pris vos marques au sein de l'équipe Public Cloud et assimilé le fonctionnement interne de la plateforme Kubernetes managée.
-
Vous aurez participé au maintien en condition opérationnelle et aux évolutions du control plane (controllers, API server, etcd), tout en automatisant les processus clés.
-
Vous aurez intégré l'IA générative dans vos routines quotidiennes de développement, de revue de code et de résolution d'incidents.
-
Vous aurez pris en main les mécanismes d'observabilité et d'AIOps pour améliorer la détection proactive des anomalies.
Et dans 1 an
- Vous aurez joué un rôle clé dans la montée en charge et la résilience globale de la plateforme Kubernetes sur des infrastructures distribuées complexes.
- Vous serez pleinement intégré à la rotation d'astreinte et garantirez la continuité de service pour l'ensemble de nos clients.
- Vous aurez fiabilisé et automatisé les mécanismes d'auto-remédiation et apporté des améliorations durables sur l'architecture distribuée.
Compétences requises :
-
Vous maîtrisez les technologies IaaS (réseau, load balancing), les serveurs, le stockage, la virtualisation et les infrastructures distribuées
-
Vous avez déjà manipulé Kubernetes en tant que client Vous disposez d'une bonne connaissance de GNU/Linux (Debian-like)
-
Vous avez une expérience en automatisation d'infrastructure (Infrastructure as Code) et des connaissances en scripting (Golang/Python, Bash)
-
Vous possédez des connaissances approfondies des principes de supervision, d'observabilité et une expérience avec les outils de tracing system
-
Vous avez une bonne compréhension des règles de sécurité informatique Vous avez une expérience en prompt engineering et une bonne compréhension des principes des chaînes agentiques et workflows autonomes (orchestration d'agents, gestion d'outils/fonctions, boucles de rétroaction)
C'est un +
- Vous communiquez sur le travail de l'équipe (vous pourriez être amené à participer à des meet-up ou conférences si vous le souhaitez).
SRE Managed Kubernetes H/F/N
Au sein de votre équipe #OneTeam
- Intégrer la Product Unit Public Cloud, au sein de l'équipe en charge de la conception, de l'évolution et de l'exploitation de l'offre Kubernetes managé.
- Développer et opérer une plateforme Kubernetes utilisée par un grand nombre de clients, reposant sur des infrastructures distribuées complexes. La fiabilité, la performance, la disponibilité, la sécurité et l'évolutivité sont des enjeux structurants de cette plateforme.
- En tant que Site Reliability Engineer expérimenté, intervenir au cœur du fonctionnement de la plateforme Kubernetes (control plane, controllers, reconciliation loops, API server, etcd) afin de garantir la stabilité et l'évolutivité du produit.
- Contribuer à l'industrialisation, à l'automatisation et à l'amélioration continue des mécanismes de fiabilité. Après une période de formation et de montée en compétence, intégrer la rotation d'astreinte de l'équipe afin d'assurer la continuité de service à nos clients.
- Au sein d'OVHcloud, adopter une approche de développement augmentée par l'IA, où l'IA générative est intégrée aux pratiques quotidiennes : conception, développement, tests, revue de code et documentation.
Vos principales responsabilités
- Garantir la disponibilité, la performance et la résilience de la plateforme haute disponibilité
- Concevoir, faire évoluer et maintenir des architectures distribuées robustes, scalables et sécurisées
- Développer des mécanismes d'automatisation, de supervision et d'auto-remédiation (Infrastructure as Code, scripts, controllers Kubernetes)
- Définir et faire évoluer les pratiques de supervision, d'observabilité et d'AIOps (métriques, logs, alerting, tracing distribué, détection d'anomalies, corrélation d'événements et analyse prédictive)
- Participer aux analyses d'incidents majeurs, implémenter les actions correctives durables et exploiter les capacités de l'IA pour accélérer l'identification des causes racines, la résolution des incidents et l'amélioration continue de la fiabilité du produit
Votre futur impact
Dans 6 mois
-
Vous aurez pris vos marques au sein de l'équipe Public Cloud et assimilé le fonctionnement interne de la plateforme Kubernetes managée.
-
Vous aurez participé au maintien en condition opérationnelle et aux évolutions du control plane (controllers, API server, etcd), tout en automatisant les processus clés.
-
Vous aurez intégré l'IA générative dans vos routines quotidiennes de développement, de revue de code et de résolution d'incidents.
-
Vous aurez pris en main les mécanismes d'observabilité et d'AIOps pour améliorer la détection proactive des anomalies.
Et dans 1 an
- Vous aurez joué un rôle clé dans la montée en charge et la résilience globale de la plateforme Kubernetes sur des infrastructures distribuées complexes.
- Vous serez pleinement intégré à la rotation d'astreinte et garantirez la continuité de service pour l'ensemble de nos clients.
- Vous aurez fiabilisé et automatisé les mécanismes d'auto-remédiation et apporté des améliorations durables sur l'architecture distribuée.
Compétences requises :
-
Vous maîtrisez les technologies IaaS (réseau, load balancing), les serveurs, le stockage, la virtualisation et les infrastructures distribuées
-
Vous avez déjà manipulé Kubernetes en tant que client Vous disposez d'une bonne connaissance de GNU/Linux (Debian-like)
-
Vous avez une expérience en automatisation d'infrastructure (Infrastructure as Code) et des connaissances en scripting (Golang/Python, Bash)
-
Vous possédez des connaissances approfondies des principes de supervision, d'observabilité et une expérience avec les outils de tracing system
-
Vous avez une bonne compréhension des règles de sécurité informatique Vous avez une expérience en prompt engineering et une bonne compréhension des principes des chaînes agentiques et workflows autonomes (orchestration d'agents, gestion d'outils/fonctions, boucles de rétroaction)
C'est un +
- Vous communiquez sur le travail de l'équipe (vous pourriez être amené à participer à des meet-up ou conférences si vous le souhaitez).