PARIS, FR, 75017
Site Reliability Engineer (F/H/N)
Au sein de votre équipe #OneTeam
-
Rejoindre le département IT, Technology & Product, qui conçoit, développe et opère les produits, les services et les infrastructures d'OVHcloud.
-
Intégrer l'équipe Delivery & Operations dans le Sovereign Group, en charge de la livraison industrialisée et de l'exploitation en production de trois plateformes souveraines (SNC Cloud Platform, OPCP, BMPOD SNC).
Vos principales responsabilités
-
Industrialiser et fiabiliser la livraison des plateformes (provisioning, configuration, GitOps avec FluxCD, Ansible, Terraform).
-
Maintenir et faire évoluer le socle Kubernetes ainsi que les opérateurs gérant le cycle de vie des plateformes.
-
Garantir la disponibilité, la performance et la sécurité en production en pilotant les SLI/SLO et les budgets d'erreur.
-
Déttecter, diagnostiquer et corriger les anomalies via Prometheus, Grafana et OpenTelemetry.
-
Traiter la cause racine des incidents, automatiser le BAU et participer à la rotation d'astreinte.
-
Assurer le durcissement (hardening), le patch management et participer aux audits de conformité (SecNumCloud).
-
Rédiger et versionner la documentation technique et les runbooks.
-
Intégrer et opérer avec des briques d'IA (copilotes de diagnostic, agents, RAG, triage d'alertes) pour augmenter l'équipe au quotidien.
Votre futur impact
Dans 6 mois
-
Vous maîtriserez le périmètre d'exploitation des plateformes souveraines et participerez en autonomie à la rotation d'astreinte.
-
Vous aurez contribué à l'industrialisation des livraisons d'infrastructure via nos pipelines GitOps et d'IaC.
-
Vous commencerez à utiliser et enrichir nos copilotes et outils d'IA d'exploitation au quotidien.
Et dans 1 an
-
Vous jouerez un rôle clé dans l'architecture et la fiabilité à long terme des plateformes cloud souveraines.
-
Vous serez autonome pour concevoir et déployer des agents ou workflows IA complexes améliorant l'observabilité et le self-healing.
-
Vous contribuerez activement aux démarches d'audit et de qualification de haut niveau de sécurité (SecNumCloud).
Compétences requises :
-
Vous maîtrisez les fondamentaux de Linux, du réseau (TCP/IP, DNS) et l'écosystème cloud-native.
-
Vous avez une expérience solide en gestion d'orchestrateurs de conteneurs en production (idéalement Kubernetes) et en pratiques SRE (SLI/SLO, astreintes, gestion d'incidents).
-
Vous maîtrisez les outils de CI/CD en mode GitOps (FluxCD, ArgoCD) ainsi que l'IaC et l'automatisation (Terraform, Ansible, Git).
-
Vous développez en Python et/ou en Go pour créer des outils et services robustes.
-
Vous avez des notions de durcissement d'infrastructure (hardening) et connaissez les mécanismes de sécurité réseau et système.
-
Vous utilisez au quotidien des outils d'IA pour optimiser vos opérations.
-
Vous êtes à l'aise en anglais pour évoluer dans un environnement international.
-
Vous êtes proactif, responsable, exigeant sur la qualité, team player et doté d'un esprit critique face aux résultats produits par l'IA.
C'est un +
-
Vous avez une expérience dans l'intégration de modèles de langage (RAG, prompt engineering, frameworks d'agents, MCP) ou le déploiement OpenStack / Bare Metal.
-
Vous connaissez les normes de qualification ou certification : SecNumCloud, PCI DSS, ISO 27001, HDS.
-
Vous avez opéré des charges GPU / serveurs d'inférence (vLLM, Triton) ou participé à des projets Open Source.
Site Reliability Engineer (F/H/N)
Au sein de votre équipe #OneTeam
-
Rejoindre le département IT, Technology & Product, qui conçoit, développe et opère les produits, les services et les infrastructures d'OVHcloud.
-
Intégrer l'équipe Delivery & Operations dans le Sovereign Group, en charge de la livraison industrialisée et de l'exploitation en production de trois plateformes souveraines (SNC Cloud Platform, OPCP, BMPOD SNC).
Vos principales responsabilités
-
Industrialiser et fiabiliser la livraison des plateformes (provisioning, configuration, GitOps avec FluxCD, Ansible, Terraform).
-
Maintenir et faire évoluer le socle Kubernetes ainsi que les opérateurs gérant le cycle de vie des plateformes.
-
Garantir la disponibilité, la performance et la sécurité en production en pilotant les SLI/SLO et les budgets d'erreur.
-
Déttecter, diagnostiquer et corriger les anomalies via Prometheus, Grafana et OpenTelemetry.
-
Traiter la cause racine des incidents, automatiser le BAU et participer à la rotation d'astreinte.
-
Assurer le durcissement (hardening), le patch management et participer aux audits de conformité (SecNumCloud).
-
Rédiger et versionner la documentation technique et les runbooks.
-
Intégrer et opérer avec des briques d'IA (copilotes de diagnostic, agents, RAG, triage d'alertes) pour augmenter l'équipe au quotidien.
Votre futur impact
Dans 6 mois
-
Vous maîtriserez le périmètre d'exploitation des plateformes souveraines et participerez en autonomie à la rotation d'astreinte.
-
Vous aurez contribué à l'industrialisation des livraisons d'infrastructure via nos pipelines GitOps et d'IaC.
-
Vous commencerez à utiliser et enrichir nos copilotes et outils d'IA d'exploitation au quotidien.
Et dans 1 an
-
Vous jouerez un rôle clé dans l'architecture et la fiabilité à long terme des plateformes cloud souveraines.
-
Vous serez autonome pour concevoir et déployer des agents ou workflows IA complexes améliorant l'observabilité et le self-healing.
-
Vous contribuerez activement aux démarches d'audit et de qualification de haut niveau de sécurité (SecNumCloud).
Compétences requises :
-
Vous maîtrisez les fondamentaux de Linux, du réseau (TCP/IP, DNS) et l'écosystème cloud-native.
-
Vous avez une expérience solide en gestion d'orchestrateurs de conteneurs en production (idéalement Kubernetes) et en pratiques SRE (SLI/SLO, astreintes, gestion d'incidents).
-
Vous maîtrisez les outils de CI/CD en mode GitOps (FluxCD, ArgoCD) ainsi que l'IaC et l'automatisation (Terraform, Ansible, Git).
-
Vous développez en Python et/ou en Go pour créer des outils et services robustes.
-
Vous avez des notions de durcissement d'infrastructure (hardening) et connaissez les mécanismes de sécurité réseau et système.
-
Vous utilisez au quotidien des outils d'IA pour optimiser vos opérations.
-
Vous êtes à l'aise en anglais pour évoluer dans un environnement international.
-
Vous êtes proactif, responsable, exigeant sur la qualité, team player et doté d'un esprit critique face aux résultats produits par l'IA.
C'est un +
-
Vous avez une expérience dans l'intégration de modèles de langage (RAG, prompt engineering, frameworks d'agents, MCP) ou le déploiement OpenStack / Bare Metal.
-
Vous connaissez les normes de qualification ou certification : SecNumCloud, PCI DSS, ISO 27001, HDS.
-
Vous avez opéré des charges GPU / serveurs d'inférence (vLLM, Triton) ou participé à des projets Open Source.