LYON, FR, 69003 TOULOUSE, FR, 31000 GRAVELINES, FR, 59820 CROIX, FR, 59170 NANTES, FR, 44000 CESSON-SEVIGNE, FR, 35510 KÖLN, DE, 50825 ROUBAIX, FR, 59100 PARIS, FR, 75017
Senior Platform Engineer / SRE - Openstack H/F/N
Au sein de votre équipe #OneTeam
-
Participer à la construction, l'exploitation et l'industrialisation de la plateforme cloud on-premise d'OVHcloud. Vous intégrerez une équipe restreinte et expérimentée, propriétaire de l'infrastructure basée sur OpenStack et de la stack Kubernetes / GitOps sur laquelle repose notre cloud client. L'ingénierie assistée par l'IA fait partie intégrante de notre quotidien (développement piloté par les spécifications, intégration d'agents, accélération des runbooks). L'enjeu clé du poste : garantir la livraison de la roadmap OPCP tout en développant les compétences clés nécessaires à l'équipe.
-
En nous rejoignant maintenant, vous aurez un impact direct sur l'architecture, la stratégie d'automatisation et l'adoption de l'IA dans l'ingénierie de la plateforme. En tant que Senior, vous façonnerez les contours de votre rôle en fonction de vos forces et intérêts, autour d'un socle d'automatisation, de cycle de vie du compute et d'ingénierie IA. Vous évoluerez dans un environnement orienté sécurité et fortement automatisé (GitOps), où vous saurez prendre des décisions éclairées au sein d'architectures complexes.
Vos principales responsabilités
-
Concevoir et construire une infrastructure cloud on-premise basée sur OpenStack capable de se déployer de manière autonome
-
Développer et maintenir l'Infrastructure as Code avec Ansible et Terraform (approche spec-first assistée par LLM et validée par l'humain, workflows de revue optimisés)
-
Piloter le développement continu de notre stack Kubernetes et de nos workflows GitOps (FluxCD / ArgoCD)
-
Assurer la responsabilité du cycle de vie de l'infrastructure compute (du bare-metal aux hyperviseurs et nœuds virtuels) et automatiser le maintien en condition opérationnelle
-
Développer et enrichir le socle IA de l'équipe (bases de connaissances Markdown pour le RAG, prototypes d'agents pour le tri d'incidents et la planification de capacité)
-
Contribuer à la démarche d'auto-réparation (self-healing) en transformant les procédures manuelles en agents autonomes
-
Concevoir et mettre en œuvre les suites de tests alignées sur les spécifications fonctionnelles et techniques (non-régression, performance, sécurité)
-
Documenter et packager la solution afin de garantir un déploiement et une exploitation fluides pour les utilisateurs
-
Améliorer en continu la plateforme sur la base de la télémétrie et des retours d'expérience
-
Agir en tant que référent technique et mentor auprès de vos pairs sur les sujets d'automatisation, de Platform Engineering et d'outillage IA
Votre futur impact
Dans 6 mois
-
Vous aurez pris vos marques au sein de l'équipe OPCP et appréhendé l'infrastructure existante basée sur OpenStack et Kubernetes. Vous comprendrez parfaitement la feuille de route et les standards d'ingénierie assistée par IA de l'équipe.
-
Vous aurez commencé à concevoir et automatiser les briques d'IaC (Ansible, Terraform) et de GitOps (FluxCD / ArgoCD), tout en contribuant activement à l'optimisation des flux de travail de l'équipe via des outils d'IA générative.
-
Vous aurez pris en main la gestion du cycle de vie du compute (bare-metal, hyperviseurs) et commencé à poser les bases des premiers scénarios d'auto-réparation.
-
Vous aurez établi des relations solides avec vos pairs et vos utilisateurs internes en documentant et simplifiant l'utilisation des solutions déployées.
Et dans 1 an
-
Vous aurez joué un rôle clé dans la livraison de la roadmap OPCP, permettant le déploiement autonome et la scalabilité de l'infrastructure cloud on-premise.
-
Vous aurez partagé votre expertise technique et méthodologique avec les équipes internes, en promouvant les meilleures pratiques d'ingénierie de plateforme et l'usage avancé des agents d'ingénierie IA.
-
Vous aurez industrialisé les processus d'auto-réparation des infrastructures et renforcé le socle de connaissances de l'équipe, rendant la plateforme encore plus résiliente et simple à opérer.
Compétences requises :
-
Vous justifiez de plusieurs années d'expérience concrète en tant que SRE, Platform Engineer ou DevOps Engineer sur des infrastructures de production
-
Vous pratiquez au quotidien l'ingénierie assistée par IA (LLM, workflows d'agents) et possédez un avis éclairé et pragmatique sur ce qui apporte une réelle valeur opérationnelle
-
Vous possédez une solide expérience sur OpenStack (déploiement, exploitation, débug en production ou contributions)
-
Vous maîtrisez la gestion bout-en-bout des infrastructures compute (du bare-metal/firmware jusqu'à la gestion des hyperviseurs et l'évacuation de hôtes)
-
Vous avez une expérience confirmée dans l'exploitation d'un orchestrateur de conteneurs en production (idéalement Kubernetes) et de son écosystème cloud-native
-
Vous disposez de compétences poussées en administration système Linux, y compris sur des environnements bare-metal
-
Vous maîtrisez parfaitement l'Infrastructure as Code (Ansible, Terraform) ainsi que les workflows GitOps (FluxCD ou ArgoCD)
-
Vous maîtrisez l'anglais à l'écrit comme à l'oral pour évoluer sereinement dans une équipe distribuée
C'est un +
-
Vous maîtrisez la programmation en Go et/ou Python pour développer du code de qualité de production
-
Vous utilisez au quotidien des environnements comme Claude Code, Cursor ou Aider, et avez déjà configuré des workflows/agents personnalisés
-
Vous êtes à l'aise avec la gestion de bases de connaissances pour le RAG (fichiers Markdown structurés, architecture ADR)
-
Vous possédez des notions en réseau (VLAN, BGP) ainsi qu'en optimisation poussée des nœuds compute (CPU pinning, NUMA, SR-IOV)
-
Vous avez une bonne connaissance des outils d'observabilité (Prometheus, Grafana, Loki, Mimir, etc.) ou des systèmes d'auto-réparation (Event-Driven Ansible, StackStorm)
Senior Platform Engineer / SRE - Openstack H/F/N
Au sein de votre équipe #OneTeam
-
Participer à la construction, l'exploitation et l'industrialisation de la plateforme cloud on-premise d'OVHcloud. Vous intégrerez une équipe restreinte et expérimentée, propriétaire de l'infrastructure basée sur OpenStack et de la stack Kubernetes / GitOps sur laquelle repose notre cloud client. L'ingénierie assistée par l'IA fait partie intégrante de notre quotidien (développement piloté par les spécifications, intégration d'agents, accélération des runbooks). L'enjeu clé du poste : garantir la livraison de la roadmap OPCP tout en développant les compétences clés nécessaires à l'équipe.
-
En nous rejoignant maintenant, vous aurez un impact direct sur l'architecture, la stratégie d'automatisation et l'adoption de l'IA dans l'ingénierie de la plateforme. En tant que Senior, vous façonnerez les contours de votre rôle en fonction de vos forces et intérêts, autour d'un socle d'automatisation, de cycle de vie du compute et d'ingénierie IA. Vous évoluerez dans un environnement orienté sécurité et fortement automatisé (GitOps), où vous saurez prendre des décisions éclairées au sein d'architectures complexes.
Vos principales responsabilités
-
Concevoir et construire une infrastructure cloud on-premise basée sur OpenStack capable de se déployer de manière autonome
-
Développer et maintenir l'Infrastructure as Code avec Ansible et Terraform (approche spec-first assistée par LLM et validée par l'humain, workflows de revue optimisés)
-
Piloter le développement continu de notre stack Kubernetes et de nos workflows GitOps (FluxCD / ArgoCD)
-
Assurer la responsabilité du cycle de vie de l'infrastructure compute (du bare-metal aux hyperviseurs et nœuds virtuels) et automatiser le maintien en condition opérationnelle
-
Développer et enrichir le socle IA de l'équipe (bases de connaissances Markdown pour le RAG, prototypes d'agents pour le tri d'incidents et la planification de capacité)
-
Contribuer à la démarche d'auto-réparation (self-healing) en transformant les procédures manuelles en agents autonomes
-
Concevoir et mettre en œuvre les suites de tests alignées sur les spécifications fonctionnelles et techniques (non-régression, performance, sécurité)
-
Documenter et packager la solution afin de garantir un déploiement et une exploitation fluides pour les utilisateurs
-
Améliorer en continu la plateforme sur la base de la télémétrie et des retours d'expérience
-
Agir en tant que référent technique et mentor auprès de vos pairs sur les sujets d'automatisation, de Platform Engineering et d'outillage IA
Votre futur impact
Dans 6 mois
-
Vous aurez pris vos marques au sein de l'équipe OPCP et appréhendé l'infrastructure existante basée sur OpenStack et Kubernetes. Vous comprendrez parfaitement la feuille de route et les standards d'ingénierie assistée par IA de l'équipe.
-
Vous aurez commencé à concevoir et automatiser les briques d'IaC (Ansible, Terraform) et de GitOps (FluxCD / ArgoCD), tout en contribuant activement à l'optimisation des flux de travail de l'équipe via des outils d'IA générative.
-
Vous aurez pris en main la gestion du cycle de vie du compute (bare-metal, hyperviseurs) et commencé à poser les bases des premiers scénarios d'auto-réparation.
-
Vous aurez établi des relations solides avec vos pairs et vos utilisateurs internes en documentant et simplifiant l'utilisation des solutions déployées.
Et dans 1 an
-
Vous aurez joué un rôle clé dans la livraison de la roadmap OPCP, permettant le déploiement autonome et la scalabilité de l'infrastructure cloud on-premise.
-
Vous aurez partagé votre expertise technique et méthodologique avec les équipes internes, en promouvant les meilleures pratiques d'ingénierie de plateforme et l'usage avancé des agents d'ingénierie IA.
-
Vous aurez industrialisé les processus d'auto-réparation des infrastructures et renforcé le socle de connaissances de l'équipe, rendant la plateforme encore plus résiliente et simple à opérer.
Compétences requises :
-
Vous justifiez de plusieurs années d'expérience concrète en tant que SRE, Platform Engineer ou DevOps Engineer sur des infrastructures de production
-
Vous pratiquez au quotidien l'ingénierie assistée par IA (LLM, workflows d'agents) et possédez un avis éclairé et pragmatique sur ce qui apporte une réelle valeur opérationnelle
-
Vous possédez une solide expérience sur OpenStack (déploiement, exploitation, débug en production ou contributions)
-
Vous maîtrisez la gestion bout-en-bout des infrastructures compute (du bare-metal/firmware jusqu'à la gestion des hyperviseurs et l'évacuation de hôtes)
-
Vous avez une expérience confirmée dans l'exploitation d'un orchestrateur de conteneurs en production (idéalement Kubernetes) et de son écosystème cloud-native
-
Vous disposez de compétences poussées en administration système Linux, y compris sur des environnements bare-metal
-
Vous maîtrisez parfaitement l'Infrastructure as Code (Ansible, Terraform) ainsi que les workflows GitOps (FluxCD ou ArgoCD)
-
Vous maîtrisez l'anglais à l'écrit comme à l'oral pour évoluer sereinement dans une équipe distribuée
C'est un +
-
Vous maîtrisez la programmation en Go et/ou Python pour développer du code de qualité de production
-
Vous utilisez au quotidien des environnements comme Claude Code, Cursor ou Aider, et avez déjà configuré des workflows/agents personnalisés
-
Vous êtes à l'aise avec la gestion de bases de connaissances pour le RAG (fichiers Markdown structurés, architecture ADR)
-
Vous possédez des notions en réseau (VLAN, BGP) ainsi qu'en optimisation poussée des nœuds compute (CPU pinning, NUMA, SR-IOV)
-
Vous avez une bonne connaissance des outils d'observabilité (Prometheus, Grafana, Loki, Mimir, etc.) ou des systèmes d'auto-réparation (Event-Driven Ansible, StackStorm)