Chargement en cours

Open Source / Red Hat IA Platform Engineer (H/F)

LEVALLOIS-PERRET, 92
il y a 5 heures
Intérim

En , l'enjeu de l'Intelligence Artificielle en entreprise a basculé du prototypage vers l'ingénierie d'infrastructure, le serving haute performance et la maîtrise des coûts GPU. En tant qu'AI Platform Engineer, vous serez au cœur de cette convergence entre Platform Engineering (Kubernetes / Open

Shift) et LLMOps. Vous concevrez, déploierez et opérerez les plateformes industrielles permettant d'entraîner, fine-tuner, orchestrer et servir des modèles d'IA générative (LLM, SLM, vision) sécurisés et souverains. 1Orchestration & Serving LLM Haute Performance (High-Throughput Inference)

Déployer, optimiser et opérer les moteurs d'inférence de pointe : v

LLM (Paged

Attention, Prefix Caching, continuous batching), LLMD, Lite

LLM Proxy, SGLang, TGI et Triton Inference Server.

Implémenter des architectures de Multi-Lo

RA Serving (S-Lo

RA) pour mutualiser un modèle de fondation unique et servir à chaud des dizaines d'adaptateurs métier sur un même GPU.

Mettre en œuvre le serving déclaratif serverless via KServe et Model

Mesh sur Red Hat Open

Shift AI (RHOAI).2Orchestration Matérielle, Batch Scheduling & GPU Fin

Ops

Déployer et configurer le NVIDIA GPU Operator, la Container Device Interface (CDI) et la Dynamic Resource Allocation (DRA).

Maximiser l'utilisation de la VRAM via le découpage NVIDIA MIG (Multi-Instance GPU) et le v

GPU time-slicing.

Déployer et configurer Kueue pour le batch scheduling multi-tenant, la gestion fine des files d'attente de jobs GPU (Cluster

Queue / Local

Queue) et le fair-sharing des quotas de calcul entre équipes.

Bâtir des architectures d'autoscaling élastique pilotées par le KV-Cache et les métriques de requêtes en attente avec KEDA et Prometheus.3Frameworks Agentiques, Pipelines RAG & Écosystème Llama Stack

Standardiser les briques d'IA générative d'entreprise en déployant le Llama Stack Operator et l'interfaçage avec les APIs unifiées d'inférence, de sécurité et d'agents.

Industrialiser des architectures RAG avancées et des workflows multi-agents avec Lang

Chain, Lang

Graph et Llama

Index.

Déployer et opérer des bases de données vectorielles distribuées à haute résilience (Milvus Distributed, Qdrant, pgvector, Chroma

DB) adossées à Open

Shift Data Foundation (Ceph / ODF).

Déployer et sécuriser des passerelles Model Context Protocol (MCP) en environnement Zero-Trust.4Fine-Tuning Souverain & Calcul Distribué

Industrialiser les pipelines d'alignement et de fine-tuning open source avec Instruct

Lab (méthode LAB) et RHEL AI sur modèles souverains et open-weights (IBM Granite 3.x, Mistral AI, Llama 3.x / 4, Deep

Seek).

Orchestrer les entraînements et traitements distribués avec Kube

Ray, Ray Serve, Kueue et Kubeflow Pipelines.5Sécurité, Gouvernance & Observabilité (IA Act Ready)

Intégrer des garde-fous éthiques et de sécurité : Ne

Mo Guardrails, Trusty

AI (explicabilité et détection des biais).

Mettre en place l'observabilité LLMOps complète avec Open

Telemetry (suivi de la latence TTFT / TPOT, traçabilité des tokens, auditabilité et Fin

Ops IA).

Automatiser l'ensemble de la stack en Git

Ops (Argo

CD / Open

Shift Git

Ops) et Ansible Automation Platform.

Plateforme de publication
France Travail
Offres pouvant vous intéresser
LYON 7E ARRONDISSEMENT, 69
il y a 22 jours
PARIS, 75
il y a 24 jours
Soyez le premier à postuler aux nouvelles offres
Soyez le premier à postuler aux nouvelles offres
Créez gratuitement et simplement une alerte pour être averti de l’ajout de nouvelles offres correspondant à vos attentes.
* Champs obligatoires
Ex: boulanger, comptable ou infirmière
Alerte crée avec succès