Mise à jour 2026
Quelques choses ont changé en France en 2026. L'AI Act encadre le recrutement par IA depuis le 2 août, 31 % des candidats utilisent déjà l'IA pour se préparer (APEC), les mises en situation remplacent les tests classiques, et le cycle de recrutement reste à 12 semaines. Lire ce qui a changé en 2026 →
Ce qui sera attendu de vous
Ce qu'ils notent- Construire des fonctionnalités produit sur des modèles de fondation : retrieval, prompting, sorties structurées, appels d'outils et agents
- Porter le dispositif d'évaluation de ces fonctionnalités : jeux de référence, LLM juge, tests de non-régression à chaque changement de prompt ou de modèle
- Tenir la latence et le coût en tokens avec du cache, du routage entre modèles et du batching, et les suivre comme des métriques produit
- Concevoir les garde-fous et les replis face aux hallucinations, aux injections et aux refus, et les surveiller en production
- Écrire le code de production autour du modèle : services, files d'attente, observabilité, tests pour des sorties probabilistes
- Travailler avec le produit, le design et la data sur ce que la fonctionnalité doit faire et sur la façon de mesurer sa qualité
Process d'entretien, round par round
6 rounds · 3 à 5 semainesLa plupart des entreprises suivent une trame similaire pour les entretiens AI Engineer. Délai calendaire total : 3 à 5 semaines du pré-screen recruteur jusqu'à l'offre.
Les fonctionnalités LLM que vous avez livrées, la stack utilisée, la motivation, les attentes de rémunération
Ce qui est noté
- Sait nommer une fonctionnalité avec de vrais utilisateurs et sa stack
- Sait pourquoi cette boîte plutôt que n'importe quel poste IA
Les fondamentaux LLM en pratique : tokens et fenêtre de contexte, sampling, structure d'un prompt, pourquoi une sortie a dérivé, plus un court exercice Python
Ce qui est noté
- Explique le comportement du modèle par le mécanisme et non par ouï-dire
- Va vers le correctif le plus simple avant le fine-tuning
Construire une petite application contre une API de modèle : questions-réponses sur des documents, un classifieur à sortie structurée, un agent qui appelle des outils. Noté sur le code qui tourne, la gestion des mauvaises sorties et les tests écrits
Ce qui est noté
- Valide et parse la sortie du modèle au lieu de lui faire confiance
- Livre quelque chose qui tourne, puis l'améliore
Concevoir un système de retrieval ou un agent de bout en bout : ingestion et découpage, embeddings et recherche hybride, re-ranking, assemblage du prompt, cache et routage de modèles, evals et garde-fous. Arbitrages entre précision, latence et coût
Ce qui est noté
- Nomme ce qui casse et comment on le détecte
- Traite les tokens comme un budget et dit où il part
Comment vous sauriez que la fonctionnalité marche : jeux de référence, juges, métriques en ligne, analyse des échecs. Ce que vous livreriez en premier et ce que vous refuseriez de livrer
Ce qui est noté
- A une réponse concrète à « comment savez-vous que c'est bon »
- Relie la qualité à un résultat pour l'utilisateur
Une fonctionnalité livrée, ce qui a cassé après le lancement, un désaccord sur le périmètre ou la qualité, la collaboration avec le produit et la data
Ce qui est noté
- Assume un échec sans accuser le modèle
- Décrit le changement fait après l'incident
AI Engineer tourne sur 6 rounds. Pour voir où se situe chaque rôle, ouvrez le rapport entretiens tech 2026.
Questions types à anticiper
10 questions qui décidentReprésentatives de ce que les entreprises demandent à ce niveau. Chaque question ici se travaille à voix haute, c'est le moyen le plus rapide de savoir si votre réponse tient face aux relances. Calibrd ajoute l'entraînement vocal avec un retour sur chaque réponse, et une simulation d'entretien complète : un tour en direct avec un intervieweur IA qui a lu le poste et votre CV, puis un débrief honnête.
- 01« Un modèle renvoie du JSON valide en test et du JSON malformé en production une fois sur cinquante. Déroulez comment vous trouvez la cause et ce que vous changez pour que la fonctionnalité n'en dépende plus jamais. »La travailler →
- 02« Écrivez une fonction qui répond à une question à partir d'un dossier de PDF. Détaillez le découpage, ce que vous embarquez, comment vous retrouvez les passages et comment vous décidez que la réponse est fondée sur le contexte. »La travailler →
- 03« Notre prompt a perdu 12 % sur le jeu de test interne après une mise à jour de modèle. Comment diagnostiquez-vous les cas qui ont régressé, et que faites-vous avant de déployer ? »La travailler →
- 04« Concevez un assistant de questions-réponses documentaire pour une entreprise avec 2 millions de pages internes. Couvrez l'ingestion, le découpage, le retrieval, le re-ranking, l'assemblage du prompt, les evals et le coût par requête. »La travailler →
- 05« Concevez un agent qui ouvre des tickets de support en appelant trois outils internes. Que peut-il faire sans confirmation, comment l'empêchez-vous de boucler, et comment le testez-vous ? »La travailler →
- 06« Concevez le système d'évaluation d'une fonctionnalité LLM qui résume des appels clients. Que contient le jeu de référence, qui le labellise, et qu'est-ce qui bloque une mise en production ? »La travailler →
- 07« Un PM veut un assistant IA sur chaque page. Par quelle page commenceriez-vous, et qu'est-ce qui vous ferait arrêter ? »La travailler →
- 08« Parlez-moi d'une fonctionnalité LLM que vous avez livrée. Qu'en ont fait les utilisateurs que vous n'aviez pas prévu ? »La travailler →
- 09« Décrivez une fois où la démo était superbe et la production non. Qu'avez-vous mesuré ensuite ? »La travailler →
- 10« Parlez-moi d'un désaccord avec le produit sur le fait qu'une fonctionnalité était assez bonne pour être livrée. »La travailler →
Ce sont les questions générales. Collez une vraie offre et Calibrd prédit celles que cette entreprise pose pour ce poste précis, puis vous interroge dessus.
Prédire mes questions →Benchmark de salaire
Rémunération typique · base, equity, bonusRémunération typique pour AI Engineer, chiffres principaux tels que le marché de référence les affiche. Quand le repère est le marché tech américain, comptez 30 à 50 % de moins en fixe à Paris, Berlin ou Singapour. La part d'equity varie beaucoup selon le stade de l'entreprise.
Le guide KORE1, mis à jour le 5 août 2026, situe les AI engineers américains mid-level (3 à 5 ans) à 140–210 k$ de fixe et 170–260 k$ de total, les seniors à 220–350 k$ de total ; la moyenne 2026 de Levels.fyi pour le titre est de 242 507 $. À Paris, le titre se paie sur la grille d'un ingénieur backend ou MLE de même niveau, avec une prime chez Mistral et Hugging Face. Les frontier labs sont sur une autre échelle : la page Levels.fyi des software engineers d'OpenAI affiche des médianes à 600 k$ et plus, lue le 11 septembre 2026.
Comment se préparer
6 conseils tactiquesOuvrez vos réponses comportementales avec la méthode STAR : Situation, Tâche, Action, Résultat. Les conseils ci-dessous s'appuient sur cette structure pour ce rôle précis.
- 01Livrez une petite application LLM de bout en bout avant d'interviewer, avec retrieval, sortie structurée et une suite de tests, et soyez prêt à en dérouler le code. Le round de build note exactement ça
- 02Travaillez trois designs canoniques à froid : questions-réponses sur un gros corpus documentaire, un agent qui appelle des outils avec des règles de confirmation, et un pipeline d'évaluation qui bloque une mise en production. Nommez l'arbitrage dans chaque composant
- 03Apprenez à parler des tokens comme d'argent et de temps. Les intervieweurs demandent où part le coût et ce que le cache, le routage et un modèle plus petit feraient économiser
- 04Lisez « AI Engineering » de Chip Huyen avant les rounds de design et d'évaluation. C'est la référence pour les evals, le retrieval et le côté production du métier
- 05Préparez quatre histoires de fonctionnalités livrées qui se terminent par ce qui a cassé et ce que vous avez changé : une hallucination repérée par les utilisateurs, une régression de prompt, une explosion du coût, une latence hors budget
- 06Soyez honnête sur ce que vous n'avez pas fait. Un intervieweur distingue une histoire de fine-tuning lue dans un article de blog d'une histoire vécue sur un vrai entraînement
Les pièges fréquents au niveau AI Engineer
À repérer en simulationQuelques erreurs fréquentes qui font recaler les candidats AI Engineer même quand ils sont par ailleurs solides. Mieux vaut les repérer en simulation avant qu'elles n'apparaissent en vrai.
Énumérer des composants au round de design sans dire ce qui casse ni comment vous le sauriez.
Pourquoi ça rate
Tous les candidats savent dire base vectorielle, re-ranker et template de prompt. Le round note les arbitrages et la gestion des échecs : ce qui se passe quand le retrieval ne remonte rien de pertinent, quand le modèle répond de mémoire au lieu du contexte, quand un changement de prompt fait régresser un cas qui passait. Un design sans histoire de détection donne à l'intervieweur l'image d'un tutoriel, pas d'un système que quelqu'un a fait tourner.
La réponse qui fait perdre
« Je découperais les documents, je les embarquerais, je les stockerais dans une base vectorielle, je récupérerais les cinq meilleurs et je les passerais au modèle avec un prompt. »
La réponse qui fait gagner
« Découpage par section avec chevauchement, recherche hybride pour que les termes exacts comme les références de pièces remontent encore, puis re-ranking des cinquante premiers vers cinq. Le risque, c'est que le modèle réponde de mémoire quand le retrieval est maigre, donc chaque réponse cite ses passages et une eval nocturne score l'ancrage sur 300 questions labellisées ; sous 92 %, le déploiement est bloqué. »
Comment rattraper
Pour chaque composant, dites la panne qu'il introduit et le contrôle qui l'attrape. Un découpage trop fin perd le contexte, donc vous mesurez l'ancrage des réponses sur un jeu de référence ; le modèle ignore le contexte, donc vous citez les passages et vous scorez la couverture des citations. Consacrez un tiers du round aux evals et au monitoring.
Traiter la sortie du modèle comme déterministe au round de build.
Pourquoi ça rate
Le round de build est celui où les intervieweurs vous regardent gérer un modèle qui se trompe parfois. Un code qui parse la réponse avec une regex sans repli, ou qui relance le même prompt en espérant une autre réponse, leur dit que vous n'avez jamais fait tourner ça en production. Le signal, c'est la logique de validation, de nouvelle tentative et de repli autour de l'appel, et les tests que vous écrivez pour des sorties que vous ne pouvez pas prévoir.
La réponse qui fait perdre
« Le modèle renvoie du JSON, donc je fais un json.loads et je lis les champs. »
La réponse qui fait gagner
« Je demande le schéma en sortie structurée, je valide, et sur un échec de validation je relance une fois avec l'erreur dans le prompt ; si ça échoue encore, la fonctionnalité renvoie le texte non résumé avec un indicateur, et le cas part dans le jeu d'évaluation. Les tests rejouent vingt réponses malformées enregistrées. »
Comment rattraper
Contraignez la sortie avec un schéma et validez-la, relancez avec un prompt corrigé en cas d'échec, et écrivez un chemin de repli qui dégrade proprement. Puis écrivez un test qui rejoue des mauvaises sorties enregistrées dans le parseur. Dites à voix haute que le modèle est une dépendance probabiliste et montrez le code qui le traite comme telle.
Répondre à la question d'évaluation au feeling : « on l'a testé et ça avait l'air bien ».
Pourquoi ça rate
Les équipes qui ont livré des fonctionnalités LLM se sont toutes fait avoir par une démo qui avait l'air bien, donc la discussion d'évaluation est le round qui sépare les candidats qui ont livré de ceux qui ont prototypé. Pas de jeu de référence, pas de juge, pas de test de non-régression, pas de métrique en ligne : aucun moyen de savoir si le prochain changement de prompt a empiré les choses, et l'intervieweur part du principe que oui.
La réponse qui fait perdre
« On l'a essayé sur un paquet d'exemples en interne et les réponses étaient bonnes, donc on a livré. »
La réponse qui fait gagner
« On a constitué un jeu de référence de 400 exemples labellisés par deux responsables support, fait tourner un LLM juge contrôlé à 10 % chaque semaine, et conditionné les mises en production à aucune régression au-delà de 2 % sur le jeu. En ligne, on suivait le taux d'utilisateurs qui modifiaient la réponse générée ; il est passé de 61 % à 38 % en six semaines. »
Comment rattraper
Décrivez un système d'évaluation avec ses pièces : un jeu de référence labellisé et qui le labellise, un juge automatique avec son propre contrôle par échantillonnage, un run de non-régression à chaque changement de prompt ou de modèle, et une métrique en ligne reliée au comportement des utilisateurs. Nommez le seuil qui bloque une mise en production.
Partir sur du fine-tuning ou un modèle plus gros avant d'essayer le correctif le moins cher.
Pourquoi ça rate
Dans les boîtes produit, les intervieweurs guettent le jugement sur les coûts. Un candidat qui propose un fine-tuning pour corriger un problème de format, ou un modèle frontier pour une tâche qu'un petit modèle gère, montre qu'il n'a jamais porté une facture de tokens. L'ordre attendu, c'est prompt, retrieval, routage et cache, puis fine-tuning quand le reste est épuisé et que les données existent.
La réponse qui fait perdre
« Les réponses ne sont pas assez cohérentes, donc je ferais un fine-tuning sur nos données. »
La réponse qui fait gagner
« L'incohérence vient ici du prompt qui laisse le format ouvert, donc je contrains d'abord le schéma de sortie et j'ajoute deux exemples ; c'est gratuit. Si le problème est la justesse et non le format, j'améliore le retrieval avant de toucher au modèle. Le fine-tuning vient en dernier, une fois qu'on a quelques milliers d'exemples labellisés et que l'eval montre que le plafond, c'est le modèle. »
Comment rattraper
Énoncez l'échelle explicitement et placez-y le problème : ce qu'un changement de prompt apporte, ce qu'un meilleur retrieval apporte, quand un modèle plus petit avec du routage suffit, et quelle preuve justifierait un fine-tuning. Attachez un coût approximatif pour mille requêtes à chaque option.
Ressources recommandées
Sans lien d'affiliationLivres, cours et outils qui reviennent le plus dans la préparation AI Engineer.
- 01AI Engineering (Chip Huyen, O'Reilly 2025) →
La référence du métier : évaluation, retrieval, agents, optimisation de l'inférence et le côté production de la construction sur des modèles de fondation. C'est elle qui fonde la barre notée par le process.
- 02GenAI and LLM system design interview guide (PracHub, avril 2026) →
Ce que couvre le round de design et comment il est noté : cadrage, finesse du retrieval, conscience des coûts, qualité et sécurité, arbitrages. Ses motifs de refus recoupent ce que disent les intervieweurs.
- 03AI engineering field guide, questions de system design (Alexey Grigorev) →
Une banque gratuite de sujets de system design IA avec les quatre motifs récurrents : orchestration RAG, boucles de feedback, ancrage, coût et latence.
- 04Hugging Face, le cours →
Pour les fondamentaux Transformers et NLP demandés au screen technique, en français et gratuit.
- 05AI Engineer salary guide 2026 (KORE1, mis à jour en août 2026) →
Les fourchettes américaines de fixe et de total par niveau, avec ses sources nommées. Les chiffres de la section rémunération viennent de là.
Scénarios courants
Situations qui reviennent souventJe suis ingénieur backend avec 4 ans d'expérience et j'ai construit un chatbot interne avec l'API d'OpenAI. Est-ce que ça suffit pour passer des entretiens d'AI Engineer ?
Ça suffit pour décrocher le screen, et pour l'offre tout dépend de ce que vous savez dire de ce chatbot au-delà du fait qu'il existe. Les intervieweurs demanderont ce qu'en ont fait les utilisateurs, comment vous saviez que les réponses étaient justes, ce que coûtait une conversation et ce qui a cassé. Si vos réponses honnêtes sont « quelques collègues l'ont utilisé », « on a lu quelques sorties » et « on n'a jamais mesuré le coût », passez quatre semaines à en faire une vraie histoire avant d'interviewer : ajoutez un jeu de référence de cinquante questions avec réponses labellisées, une eval nocturne, un tableau de bord des coûts et une sortie structurée avec validation. Le même projet devient alors la preuve de tout le process. Votre profondeur backend est un atout au round de build et au round de design, là où la plupart des candidats venus de la data sont plus faibles sur les services, les files d'attente et l'observabilité. Menez avec ça. Ne revendiquez pas une expérience de fine-tuning tirée d'un tutoriel ; le screen technique la trouvera.
Je suis ML engineer et j'entraîne des modèles. Pourquoi prendre un poste d'AI Engineer, et qu'est-ce qui change dans l'entretien ?
Le travail passe de l'entraînement à la composition. En 2026, la plupart des équipes produit n'entraînent pas de modèles ; elles construisent sur des modèles hébergés, et les problèmes difficiles ont migré vers le retrieval, l'évaluation, l'orchestration, le coût et les garde-fous. En entretien, votre profondeur en modélisation compte encore au screen technique, mais le round de design ne vous demandera pas un pipeline d'entraînement ; il demande un système de retrieval ou un agent et note les arbitrages. La discussion d'évaluation est celle où vous pouvez briller, parce que vous pensez déjà en jeux de test et en métriques, à condition de traduire ça en termes LLM : jeux de référence, juges, seuils de non-régression sur les changements de prompt. Le round de build peut surprendre les ML engineers qui vivent dans les notebooks ; il veut un petit service avec validation, tests et un chemin de repli, écrit comme un ingénieur backend l'écrit. Entraînez-vous à ça. Côté rémunération, le titre AI Engineer en boîte produit se situe près du MLE de même niveau, et les labs paient bien au-dessus des deux.
Le take-home me demande de construire une application RAG sur un jeu de documents en un week-end. Qu'est-ce qu'ils notent vraiment ?
Trois choses, dans cet ordre. D'abord, est-ce que ça tourne et répond juste sur leurs documents, avec un README qui permet à un relecteur de le reproduire en cinq minutes. Ensuite, comment vous avez géré le modèle qui se trompe : sorties structurées avec validation, citations vers les passages sources, une réponse sensée quand le retrieval ne trouve rien, et des tests qui rejouent de mauvaises sorties. Enfin, votre jugement sur les arbitrages, écrit dans le README : pourquoi cette taille de découpage, pourquoi une recherche hybride ou pourquoi pas, ce que coûte une requête, ce que vous construiriez ensuite avec une semaine de plus. Les candidats perdent le take-home en passant le week-end sur une belle interface et zéro évaluation. Un petit script d'eval avec vingt questions labellisées et un score vaut plus que n'importe quelle interface. Gardez une stack sobre et du code testé ; l'entretien de restitution qui suit sert à vérifier que vous comprenez chaque ligne, y compris celles écrites par un assistant de code.
J'ai 6 ans comme ingénieur full-stack et je veux passer à l'AI engineering sans bagage en maths ni en ML. L'entretien va-t-il me le faire payer ?
Moins que vous ne le pensez, tant que vous savez expliquer le comportement d'un modèle par son mécanisme. Le screen technique demande ce qu'est un token, pourquoi la fenêtre de contexte compte, pourquoi la température change les réponses, à quoi sert un embedding. C'est quelques semaines de lecture, et « AI Engineering » de Chip Huyen le couvre dans l'ordre où les intervieweurs le demandent. Personne en boîte produit ne vous demandera de dériver l'attention. Ce qu'on vous demandera, c'est si vous avez livré quelque chose sur un modèle, donc construisez une vraie fonctionnalité avant de postuler et mesurez-la. Votre bagage full-stack est un atout au round de build, noté sur un service qui tourne avec validation et tests, et dans les conversations produit, où vous savez parler de ce que font les utilisateurs. L'écart à combler, c'est l'évaluation : apprenez ce que sont un jeu de référence, un LLM juge et un seuil de non-régression, et utilisez-les sur votre propre projet pour que l'histoire soit la vôtre.
Je passe des entretiens dans une startup AI-native et dans un grand groupe produit pour le même titre. En quoi les process diffèrent-ils ?
Le process de la startup est en général plus court et plus concret : un fondateur ou un lead au screen, un round de build sur leur vrai problème, parfois un essai rémunéré, et une conversation de design qui creuse un seul système plutôt que d'en survoler plusieurs. Ils notent la vitesse, le goût et le fait d'avoir vraiment utilisé les outils du moment. Le process du grand groupe est plus long et plus standardisé : un screen de coding qui peut encore contenir un exercice d'algorithmique, un round de design tiré d'une rotation de sujets, un round comportemental à part avec une grille de niveau, et un comité de recrutement. Ils notent la constance et l'adéquation à un niveau. Préparez les deux avec une fonctionnalité livrée que vous savez démonter sous tous les angles, trois designs canoniques que vous savez dessiner à froid, et une histoire d'évaluation avec des chiffres. Pour le grand groupe, ajoutez deux semaines d'algorithmique ; pour la startup, utilisez leur produit pendant une semaine et arrivez avec deux choses précises que vous changeriez.
Questions fréquentes
Est-ce le même guide que celui de ML Engineer, et lequel lire en premier ?
Non. Le process ML Engineer note l'entraînement, le serving et le ML system design à échelle modérée, avec une barre coding proche de celle d'un software engineer. Le process AI Engineer note la construction sur des modèles de fondation hébergés : retrieval, sorties structurées, agents, évaluation et coût. Si l'offre parle d'entraîner, de fine-tuner ou de servir des modèles, lisez le guide ML Engineer. Si elle parle de fonctionnalités sur des API de LLM, de RAG, d'agents ou d'evals, c'est celui-ci. Beaucoup d'équipes emploient les deux titres de façon lâche, donc lisez les responsabilités de l'offre plutôt que le titre.
Combien de temps prévoir avant un onsite AI Engineer ?
Le process prend 3 à 5 semaines. Avant qu'il commence, livrez une petite fonctionnalité LLM de bout en bout avec un script d'évaluation et des tests, et travaillez trois designs canoniques : questions-réponses sur un gros corpus, un agent qui appelle des outils, et un pipeline d'évaluation qui bloque une mise en production. La discussion d'évaluation est le round que la plupart des candidats n'ont jamais préparé.
Quelle est l'erreur la plus fréquente des candidats au niveau AI Engineer ?
Décrire des composants au lieu des pannes. Les candidats énumèrent bases vectorielles et re-rankers sans jamais dire ce qui casse, comment ils le détectent ni ce que ça coûte. Les intervieweurs notent les arbitrages et l'histoire d'évaluation, et un design sans les deux passe pour un tutoriel.
Et si mon process d'entretien diffère de celui décrit ici ?
L'essentiel de la variation est marginal. Les grandes boîtes tech (FAANG, scale-ups, SaaS mid-size) suivent un process à 1–2 rounds près de ce qui est décrit. Les petites startups tournent souvent sur moins de rounds (3 à 4) mais la barre par round reste similaire ; les boîtes moins matures tech sautent parfois system design ou comportemental. Lisez l'offre et demandez au recruteur lors du pré-screen, il vous dira ce qui vient.
Comment ce guide se compare-t-il au scan gratuit ?
Ce guide couvre la barre générale au niveau L4 / IC3 à IC4. Le scan gratuit lit votre offre d'emploi spécifique et renvoie les questions prédites pour ce poste + cette entreprise, un benchmark de salaire ajusté au poste et, avec votre CV, une lecture de vos écarts d'expérience et un passage ATS de CV, envoyés en PDF.
Passez à votre vraie offre
Collez n'importe quelle offre AI Engineer, découvrez votre coach en moins de 30 secondes.
Déposez une URL LinkedIn, Greenhouse, Lever ou Levels.fyi, ou collez le texte de l'offre. Votre coach prédit les questions pour cette entreprise, fait ressortir vos écarts d'expérience, et calibre un benchmark de salaire pour le poste et la localisation. PDF par e-mail. Ensuite, répétez le tour à voix haute avec un retour honnête jusqu'à être prêt.
Gratuit pour commencer · Sans carte · CV chiffré, supprimable à tout moment