Vous voulez contribuer à des projets uniques pour construire ensemble le cloud libre ? Allons-y !
Chez OVHcloud, nous sommes animés par la même volonté, celle de construire l’avenir ensemble pour défendre la liberté d’innover.

► Découvrez l’acteur majeur du cloud libre et responsable

DÉTAILS

CDI
IT, Technologie & Produit

LYON, FR, 69003

VOTRE MISSION

AI Infrastructure Engineer - Inference, Serving, Training & Data de production H/F/N

 

Au sein de votre équipe #OneTeam

  • Intégrer l’équipe AI Infrastructure & Data au sein de la BU AI. Votre mission sera de concevoir, déployer, superviser et maintenir en conditions opérationnelles l’infrastructure dédiée à l’entraînement (training) et à l’inférence des modèles d’intelligence artificielle pour nos besoins internes.
  • Fournir aux équipes Data Science, ML Engineering et produits internes une plateforme IA performante, disponible, sécurisée et efficiente en coûts et en énergie, en s’appuyant sur nos datacenters et notre savoir-faire industriel. Ces utilisateurs, vos futurs collègues, exploiteront notre infrastructure GPU, de stockage et réseau afin d'utiliser une plateforme hautement automatisée en self-service, du dataset au modèle en production.

 

Vos principales responsabilités

  • Concevoir, déployer et opérer notre plateforme d’inférence interne (vLLM, Triton, autoscaling, batching, multi-tenancy, haute disponibilité)

  • Optimiser la latence, le débit et le coût de l’inférence (quantization, placement des modèles, dimensionnement des ressources GPU)

  • Assurer l’exploitation des workloads de training et de fine-tuning sur le socle de calcul opéré par l’équipe

  • Porter la continuité de la chaîne training vers inférence en industrialisant le passage du checkpoint au modèle servi en production

  • Être responsable des données du cycle de vie des modèles (registre, versioning, traçabilité dataset-entraînement-modèle-déploiement)

  • Être responsable des données de production de l’inférence (logging, anonymisation, rétention) Mettre à disposition les données de feedback pour le réentraînement et le fine-tuning des modèles

  • Définir avec les équipes clientes les standards de mise en production des modèles

  • Participer à l’astreinte, rédiger les runbooks, contribuer aux post-mortems et automatiser la remédiation

  • Remettre constamment en question ce qui existe et explorer ce qui doit évoluer pour répondre aux besoins internes Appliquer les aspects de sécurité matériel, logiciel et data sur toute la chaîne de valeur

  • Travailler en étroite collaboration avec les équipes OVHcloud France et à l’International

 

Votre futur impact

 

Dans 6 mois

  • Vous aurez pris vos marques au sein de l’équipe AI Infrastructure & Data et de la BU AI.
  • Vous comprendrez l’infrastructure existante, les défis d’optimisation du serving de modèles et les besoins des équipes internes.
  • Vous aurez participé au déploiement et à l'optimisation de la stack d'inférence (vLLM, Triton), apportant votre expertise pour réduire la latence et maximiser le débit des modèles en production.
  • Vous aurez établi des relations avec les équipes Data Science et ML Engineering, recueillant leurs retours sur l'ordonnancement des jobs de training et le cycle de vie des checkpoints.
  • Vous aurez exploré l'industrialisation du passage du training à l'inférence afin de fluidifier la mise en production des modèles.

 

Et dans 1 an

  • Vous aurez joué un rôle clé dans la construction de la boucle de feedback complète, permettant la réinjection des données d'inférence vers le réentraînement et le fine-tuning.
  • Vous aurez fiabilisé et sécurisé l'ensemble du registre de modèles et la traçabilité des données de production de l'inférence.
  • Vous aurez partagé vos bonnes pratiques et vos standards de mise en production avec les équipes clientes, renforçant l'autonomie des utilisateurs sur la plateforme self-service.

 

Compétences requises :

  • Vous possédez plus de 5 ans d'expérience dans l'ingénierie de plateformes ou l'exploitation de services à grande échelle en production.
  • Vous maîtrisez le déploiement de services de serving de modèles ML/LLM (vLLM, Triton, TGI, KServe) ainsi que les approches d'optimisation (quantization, ONNX, TensorRT).
  • Vous avez une expérience concrète de l'exploitation de workloads de training et d'ordonnancement de jobs (Slurm, Kueue, Volcano).
  • Vous disposez de solides connaissances de Kubernetes, des patterns de scalabilité, du développement (Python, Go, Bash) et des pratiques CI/CD / GitOps. Vous maîtrisez la gestion des données de production (logging, anonymisation, conformité).
  • Vous êtes autonome, reconnu pour être un facilitateur, curieux et capable d'évoluer dans un environnement international (anglais courant).

 

C'est un +

  • Vous maîtrisez les frameworks d’entraînement distribué (PyTorch DDP/FSDP) ou les outils MLOps (MLflow, Weights & Biases).

NOTRE PARCOURS DE RECRUTEMENT

1. Échange avec notre Talent Acquisition Specialist:  Magali
2. Entretien avec le Manager:  Gilles

3. Cas pratique (si pertinent)
4. Rencontre avec un pair, un membre de l'équipe ou de la direction
5. Débriefing ensemble

NOS AVANTAGES ET BÉNÉFICES

✔︎ Une politique de télétravail hybride
✔︎ Un plan d'actionnariat salarié
✔︎ Un programme de reconnaissance de l'ancienneté
✔︎ Des subventions vacances et sport
✔︎ Berceau et crèche d'entreprise (selon site)

Mais aussi :
✔︎ Des équipes multiculturelles
✔︎ Des locaux bien équipés 
✔︎ Une plateforme de formation et de certification en ligne
✔︎ Une offre d'accompagnement médical et social digitalisée pour vous et votre famille

REJOINDRE L’AVENTURE OVHCLOUD

OVHcloud valorise la diversité des personnes qu’elle embauche et accompagne.
La diversité pour nous, c’est favoriser un milieu de travail où les différences individuelles sont reconnues, appréciées et respectées de façon à développer le plein potentiel et les forces de chacune et chacun.
Soyez libre d’être vous-même !

L'IA DANS L'ADN

L'intelligence artificielle réinvente nos métiers au quotidien.
Rejoignez-nous pour explorer ses immenses possibilités et coconstruire l'avenir !

LE DÉVELOPPEMENT DURABLE CHEZ OVHCLOUD, UN ENGAGEMENT PROFOND

► Explorez nos engagements qui font la différence

À CHACUNE SON POTENTIEL, OSEZ POSTULER !

Nous savons que les femmes peuvent parfois s'abstenir de postuler si elles ne répondent pas à 100% des critères d'une offre.
Nous souhaitons clarifier : nos fiches de poste sont des repères, pas des barrières. Nous avons hâte de recevoir votre candidature.

Cette offre ne répond pas tout à fait à vos attentes ? Candidatez malgré tout !
C'est l'occasion de partager votre profil avec nos recruteurs, vous faire remarquer et peut-être recontacter pour une autre opportunité.

Cette offre ne répond pas tout à fait à vos attentes ? Candidatez spontanément sur le portail candidat pour rejoindre l'une de nos équipes !
L'occasion de partager votre profil avec nos recruteurs, vous faire remarquer et peut-être recontacter pour une autre opportunité.

Vous voulez contribuer à des projets uniques pour construire ensemble le cloud libre ? Allons-y ! Chez OVHcloud, nous sommes animés par la même volonté, celle de construire l’avenir ensemble pour défendre la liberté d’innover.

► Découvrez l'acteur majeur du cloud libre et responsable

VOTRE MISSION

AI Infrastructure Engineer - Inference, Serving, Training & Data de production H/F/N

 

Au sein de votre équipe #OneTeam

  • Intégrer l’équipe AI Infrastructure & Data au sein de la BU AI. Votre mission sera de concevoir, déployer, superviser et maintenir en conditions opérationnelles l’infrastructure dédiée à l’entraînement (training) et à l’inférence des modèles d’intelligence artificielle pour nos besoins internes.
  • Fournir aux équipes Data Science, ML Engineering et produits internes une plateforme IA performante, disponible, sécurisée et efficiente en coûts et en énergie, en s’appuyant sur nos datacenters et notre savoir-faire industriel. Ces utilisateurs, vos futurs collègues, exploiteront notre infrastructure GPU, de stockage et réseau afin d'utiliser une plateforme hautement automatisée en self-service, du dataset au modèle en production.

 

Vos principales responsabilités

  • Concevoir, déployer et opérer notre plateforme d’inférence interne (vLLM, Triton, autoscaling, batching, multi-tenancy, haute disponibilité)

  • Optimiser la latence, le débit et le coût de l’inférence (quantization, placement des modèles, dimensionnement des ressources GPU)

  • Assurer l’exploitation des workloads de training et de fine-tuning sur le socle de calcul opéré par l’équipe

  • Porter la continuité de la chaîne training vers inférence en industrialisant le passage du checkpoint au modèle servi en production

  • Être responsable des données du cycle de vie des modèles (registre, versioning, traçabilité dataset-entraînement-modèle-déploiement)

  • Être responsable des données de production de l’inférence (logging, anonymisation, rétention) Mettre à disposition les données de feedback pour le réentraînement et le fine-tuning des modèles

  • Définir avec les équipes clientes les standards de mise en production des modèles

  • Participer à l’astreinte, rédiger les runbooks, contribuer aux post-mortems et automatiser la remédiation

  • Remettre constamment en question ce qui existe et explorer ce qui doit évoluer pour répondre aux besoins internes Appliquer les aspects de sécurité matériel, logiciel et data sur toute la chaîne de valeur

  • Travailler en étroite collaboration avec les équipes OVHcloud France et à l’International

 

Votre futur impact

 

Dans 6 mois

  • Vous aurez pris vos marques au sein de l’équipe AI Infrastructure & Data et de la BU AI.
  • Vous comprendrez l’infrastructure existante, les défis d’optimisation du serving de modèles et les besoins des équipes internes.
  • Vous aurez participé au déploiement et à l'optimisation de la stack d'inférence (vLLM, Triton), apportant votre expertise pour réduire la latence et maximiser le débit des modèles en production.
  • Vous aurez établi des relations avec les équipes Data Science et ML Engineering, recueillant leurs retours sur l'ordonnancement des jobs de training et le cycle de vie des checkpoints.
  • Vous aurez exploré l'industrialisation du passage du training à l'inférence afin de fluidifier la mise en production des modèles.

 

Et dans 1 an

  • Vous aurez joué un rôle clé dans la construction de la boucle de feedback complète, permettant la réinjection des données d'inférence vers le réentraînement et le fine-tuning.
  • Vous aurez fiabilisé et sécurisé l'ensemble du registre de modèles et la traçabilité des données de production de l'inférence.
  • Vous aurez partagé vos bonnes pratiques et vos standards de mise en production avec les équipes clientes, renforçant l'autonomie des utilisateurs sur la plateforme self-service.

 

Compétences requises :

  • Vous possédez plus de 5 ans d'expérience dans l'ingénierie de plateformes ou l'exploitation de services à grande échelle en production.
  • Vous maîtrisez le déploiement de services de serving de modèles ML/LLM (vLLM, Triton, TGI, KServe) ainsi que les approches d'optimisation (quantization, ONNX, TensorRT).
  • Vous avez une expérience concrète de l'exploitation de workloads de training et d'ordonnancement de jobs (Slurm, Kueue, Volcano).
  • Vous disposez de solides connaissances de Kubernetes, des patterns de scalabilité, du développement (Python, Go, Bash) et des pratiques CI/CD / GitOps. Vous maîtrisez la gestion des données de production (logging, anonymisation, conformité).
  • Vous êtes autonome, reconnu pour être un facilitateur, curieux et capable d'évoluer dans un environnement international (anglais courant).

 

C'est un +

  • Vous maîtrisez les frameworks d’entraînement distribué (PyTorch DDP/FSDP) ou les outils MLOps (MLflow, Weights & Biases).

Cette offre ne répond pas tout à fait à vos attentes ? Candidatez malgré tout !
C'est l'occasion de partager votre profil avec nos recruteurs, vous faire remarquer et peut-être recontacter pour une autre opportunité.

Cette offre ne répond pas tout à fait à vos attentes ? Candidatez spontanément sur le portail candidat pour rejoindre l'une de nos équipes !
L'occasion de partager votre profil avec nos recruteurs, vous faire remarquer et peut-être recontacter pour une autre opportunité.