Ingénieur MLOps F/H
ÎLE- E FRANCE, FRANCE
il y a 3 jours
- Dimensionner et déployer le cluster GPU sur OVHcloud : choix des instances et des cartes, arbitrages coût / mémoire / débit, réseau et stockage adaptés aux poids de modèles, le tout décrit en Terraform comme le reste de notre infrastructure.
- Industrialiser la couche GPU : drivers et pilotes CUDA, runtime conteneur GPU, opérateur GPU sur Kubernetes, partage et ordonnancement des cartes entre charges de travail, mise à l'échelle et extinction des ressources inutilisées.
- Opérer les serveurs d'inférence : déploiement et réglage de moteurs type vLLM ou équivalents, gestion du cycle de vie des modèles et de leurs versions, quantification, batching, mesure et optimisation de la latence et du débit.
- Exposer une passerelle LLM interne : API compatible avec les clients standards, authentification, quotas et suivi de consommation, journalisation - pour les applications comme pour les outils de l'équipe.
- Construire les briques applicatives d'appui : embeddings et recherche vectorielle, chaînes de RAG sur nos référentiels et notre documentation, évaluation de la qualité des réponses.
- Garantir le cadre données de santé : isolation stricte des environnements, aucune donnée sortante, traçabilité des accès et des inférences, en lien avec la sécurité et la conformité.
- Observer et maîtriser les coûts : métriques GPU, saturation, taux d'occupation, coût par requête et par usage - la sobriété fait partie du travail.
- Contribuer au socle commun : l'infrastructure GPU n'est pas une île, vous participez aussi à l'IaC, à la CI et au run de l'équipe.
Entreprise
CENTRE DE LA FORMATION ET DU DÉVELOPPEMENT DES COMPÉTENCES
Plateforme de publication
WHATJOBS
Offres pouvant vous intéresser
PARIS, 75
il y a 5 jours
PARIS, 75
il y a 8 jours