PARIS, FR, 75017 TOULOUSE, FR, 31000 MONTRÉAL (QUÉBEC), CA, H3A 2N4 CESSON-SEVIGNE, FR, 35510 BORDEAUX, FR, 33000 LYON, FR, 69003 NANTES, FR, 44000 ROUBAIX, FR, 59100 BREST, FR, 29200
Ingénieur SRE Storage & AIOps H/F/N
Au sein de votre équipe #OneTeam
- Intégrer l’équipe en charge de la résilience et de la haute disponibilité de nos infrastructures de stockage (EFS et ZFS).
- Construire une infrastructure proactive et prédictive, assurant une restauration automatisée ou ultra-rapide des services en cas d'incident.
- L'enjeu est de transformer notre quotidien opérationnel en intégrant l'intelligence artificielle au cœur de notre gestion d'infrastructure à très grande échelle.
Vos principales responsabilités
-
Garantir le maintien en condition opérationnelle (MCO), la haute disponibilité et la performance des infrastructures de stockage EFS et ZFS
-
Prendre en charge et résoudre les incidents (alertes, tickets clients) tout en menant des analyses de cause racine (post-mortems)
-
Concevoir, déployer et optimiser les outils de monitoring et de métrologie pour passer d'une gestion réactive à une approche proactive
-
Diffuser la culture DevOps ainsi que les bonnes pratiques de développement, d'automatisation et de collaboration au sein de l'équipe
-
Identifier, intégrer et faire grandir les cas d'usage de l'IA appliquée aux opérations (analyse prédictive des pannes, optimisation de la capacité, détection d'anomalies)
-
Traduire le potentiel de l'AIOps en outils concrets pour simplifier et automatiser les tâches répétitives de l'équipe
-
Mettre en place une approche Infrastructure as Code et industrialiser nos chaînes CI/CD
Votre futur impact
Dans 6 mois
- Vous aurez pris vos marques au sein de l'équipe et appréhendé l'écosystème de nos infrastructures de stockage EFS et ZFS.
- Vous aurez pris en main le maintien en condition opérationnelle et la gestion des incidents, en apportant vos premières analyses post-mortem.
- Vous aurez commencé à optimiser nos suites d'observabilité existantes pour améliorer la détection d'anomalies et la réactivité des alertes.
- Vous aurez identifié les premiers cas d'usage AIOps et commencé à prototyper des outils d'automatisation basés sur l'IA pour l'équipe.
Et dans 1 an
- Vous aurez déployé des solutions AIOps concrètes en production, permettant la prédiction de pannes et l'automatisation de la restauration des services.
- Vous aurez modernisé nos pratiques grâce à une approche Infrastructure as Code généralisée et des pipelines CI/CD optimisés.
- Vous aurez diffusé la culture DevOps et AIOps au sein de l'équipe en mentorant vos pairs sur les outils d'automatisation et de génération de code.
- Vous aurez apporté une contribution majeure à l'excellence opérationnelle et à l'autonomie de nos infrastructures de stockage.
Compétences requises :
-
Vous maîtrisez parfaitement l'approche Infrastructure as Code (Terraform, Ansible, Salt, Puppet) et les chaînes de CI/CD (GitLab CI, GitHub Actions)
-
Vous disposez d'une expérience solide sur les suites d'observabilité (Grafana, Prometheus, Zabbix, OpenSearch, Graylog) pour la collecte de métriques, traces et la corrélation de logs
-
Vous maîtrisez les concepts AIOps (analyse prédictive, détection d'anomalies par ML, corrélation intelligente) ainsi que le Prompt Engineering et les assistants de génération de code Vous possédez une excellente connaissance des environnements Linux et/ou Cloud Native (Kubernetes, Docker)
-
Vous maîtrisez au moins un langage de script ou de développement orienté Ops et automatisation (Python, Go ou Bash avancé)
-
Vous êtes autonome et capable de travailler dans un environnement en évolution rapide
C'est un +
- Vous avez une expérience approfondie sur les systèmes de fichiers distribués ou de stockage à forte échelle (NetApp, ZFS).
Ingénieur SRE Storage & AIOps H/F/N
Au sein de votre équipe #OneTeam
- Intégrer l’équipe en charge de la résilience et de la haute disponibilité de nos infrastructures de stockage (EFS et ZFS).
- Construire une infrastructure proactive et prédictive, assurant une restauration automatisée ou ultra-rapide des services en cas d'incident.
- L'enjeu est de transformer notre quotidien opérationnel en intégrant l'intelligence artificielle au cœur de notre gestion d'infrastructure à très grande échelle.
Vos principales responsabilités
-
Garantir le maintien en condition opérationnelle (MCO), la haute disponibilité et la performance des infrastructures de stockage EFS et ZFS
-
Prendre en charge et résoudre les incidents (alertes, tickets clients) tout en menant des analyses de cause racine (post-mortems)
-
Concevoir, déployer et optimiser les outils de monitoring et de métrologie pour passer d'une gestion réactive à une approche proactive
-
Diffuser la culture DevOps ainsi que les bonnes pratiques de développement, d'automatisation et de collaboration au sein de l'équipe
-
Identifier, intégrer et faire grandir les cas d'usage de l'IA appliquée aux opérations (analyse prédictive des pannes, optimisation de la capacité, détection d'anomalies)
-
Traduire le potentiel de l'AIOps en outils concrets pour simplifier et automatiser les tâches répétitives de l'équipe
-
Mettre en place une approche Infrastructure as Code et industrialiser nos chaînes CI/CD
Votre futur impact
Dans 6 mois
- Vous aurez pris vos marques au sein de l'équipe et appréhendé l'écosystème de nos infrastructures de stockage EFS et ZFS.
- Vous aurez pris en main le maintien en condition opérationnelle et la gestion des incidents, en apportant vos premières analyses post-mortem.
- Vous aurez commencé à optimiser nos suites d'observabilité existantes pour améliorer la détection d'anomalies et la réactivité des alertes.
- Vous aurez identifié les premiers cas d'usage AIOps et commencé à prototyper des outils d'automatisation basés sur l'IA pour l'équipe.
Et dans 1 an
- Vous aurez déployé des solutions AIOps concrètes en production, permettant la prédiction de pannes et l'automatisation de la restauration des services.
- Vous aurez modernisé nos pratiques grâce à une approche Infrastructure as Code généralisée et des pipelines CI/CD optimisés.
- Vous aurez diffusé la culture DevOps et AIOps au sein de l'équipe en mentorant vos pairs sur les outils d'automatisation et de génération de code.
- Vous aurez apporté une contribution majeure à l'excellence opérationnelle et à l'autonomie de nos infrastructures de stockage.
Compétences requises :
-
Vous maîtrisez parfaitement l'approche Infrastructure as Code (Terraform, Ansible, Salt, Puppet) et les chaînes de CI/CD (GitLab CI, GitHub Actions)
-
Vous disposez d'une expérience solide sur les suites d'observabilité (Grafana, Prometheus, Zabbix, OpenSearch, Graylog) pour la collecte de métriques, traces et la corrélation de logs
-
Vous maîtrisez les concepts AIOps (analyse prédictive, détection d'anomalies par ML, corrélation intelligente) ainsi que le Prompt Engineering et les assistants de génération de code Vous possédez une excellente connaissance des environnements Linux et/ou Cloud Native (Kubernetes, Docker)
-
Vous maîtrisez au moins un langage de script ou de développement orienté Ops et automatisation (Python, Go ou Bash avancé)
-
Vous êtes autonome et capable de travailler dans un environnement en évolution rapide
C'est un +
- Vous avez une expérience approfondie sur les systèmes de fichiers distribués ou de stockage à forte échelle (NetApp, ZFS).