Mise à jour 2026
Quelques choses ont changé en France en 2026. L'AI Act encadre le recrutement par IA depuis le 2 août, 31 % des candidats utilisent déjà l'IA pour se préparer (APEC), les mises en situation remplacent les tests classiques, et le cycle de recrutement reste à 12 semaines. Lire ce qui a changé en 2026 →
Ce qui sera attendu de vous
Ce qu'ils notent- Concevoir, lancer et analyser des expériences sur de grands modèles avec les chercheurs, du premier script au write-up
- Construire et faire passer à l'échelle l'infrastructure de training : pipelines de données, training distribué, checkpointing, débit et fiabilité
- Construire des évaluations, trouver les modes de défaillance et en faire des environnements de training ou des datasets
- Porter le tooling de dev et le suivi d'expériences sur lesquels l'équipe tourne
- Implémenter et optimiser des composants de modèle, en PyTorch ou JAX, au niveau des shapes de tenseurs et des kernels
- Faire du pair programming avec les chercheurs au quotidien et prendre le travail hors fiche de poste quand le projet en a besoin
Process d'entretien, round par round
8 rounds · 3 à 8 semainesLa plupart des entreprises suivent une trame similaire pour les entretiens Research Engineer. Délai calendaire total : 3 à 8 semaines du pré-screen recruteur jusqu'à l'offre.
Quelle équipe, quels problèmes, pourquoi ce lab, et une calibration de ce que vous avez construit. Anthropic et OpenAI posent la question de la mission ici, avant toute ligne de code
Anthropic : un test CodeSignal de 90 minutes, une classe exposant une API publique construite en quatre niveaux, où les candidats rapportent que la vitesse et le passage de tous les cas comptent plus que l'élégance. OpenAI et les autres : un problème pratique comme un cache LRU ou un rate limiter, jugé sur du code propre qui marche
Ce qui est noté
- Du code qui marche vite, sous contrainte de temps, cas limites couverts
- Une structure lisible, car le relecteur lit le code après l'exécution
- En direct, parler en tapant sans se figer
Implémenter de mémoire un morceau substantiel d'architecture : l'attention avec masking, un bloc Transformer, une boucle de training avec gradient clipping. Les shapes de tenseurs, la contiguïté et la mémoire sont la notation, et le Transformer est le sujet par défaut
Ce qui est noté
- Les bonnes shapes à chaque étape, dites à voix haute avant le code
- Masking et stabilité numérique gérés sans qu'on vous le souffle
- Savoir ce que le framework fait sous le capot, contiguïté et broadcasting compris
OpenAI envoie un papier deux ou trois jours avant ; vous présentez sa contribution, sa méthode, ses résultats, ses limites et ce que vous tenteriez ensuite. Chez Anthropic, la même heure est un deep dive sur un de vos projets, et les questions visent les décisions que vous avez prises et celles que vous n'avez pas prises
Ce qui est noté
- Séparer ce que le papier a montré de ce qu'il a affirmé
- Une extension concrète et peu coûteuse que vous lanceriez en premier
- Assumer les décisions de votre propre projet plutôt que celles de l'équipe
Des questions ouvertes d'un lead de recherche : qu'essaieriez-vous, pourquoi, qu'est-ce qui vous dirait que ça marche. Un récit de candidat décrit 15 minutes, deux questions, et une élimination après trois minutes de silence
Ce qui est noté
- Des idées dans la première minute, affinées à voix haute, pas une réponse finie
- Dire quel résultat vous ferait changer d'avis
- La conscience du coût : quelle expérience est assez bon marché pour passer en premier
Designer le système de training ou de serving d'un modèle et d'un budget donnés, ou débugger un run qui a dérapé : une loss qui plafonne, un débit divisé par deux, un écart entre deux chiffres d'évaluation. DeepMind ajoute un quiz rapide de fondamentaux où les candidats venus de l'industrie rapportent échouer sur les définitions formelles
Les postes recherche et research engineering d'Anthropic en incluent généralement un : un jeu de problèmes ou un petit dataset, ou l'analyse d'une API de modèle en boîte noire, avec présentation des résultats ensuite. Sans assistance IA sauf si l'énoncé le dit
La motivation, la façon de travailler avec des chercheurs, et chez Anthropic la manière de raisonner sur la sécurité. Les prises de références se font pendant le process plutôt qu'après l'offre. Les candidats qui se montrent dédaigneux sur la sécurité, préfèrent travailler seuls ou visent surtout l'argent rapportent s'arrêter ici
Research Engineer tourne sur 8 rounds. Pour voir où se situe chaque rôle, ouvrez le rapport entretiens tech 2026.
Questions types à anticiper
9 questions qui décidentReprésentatives de ce que les entreprises demandent à ce niveau. Chaque question ici se travaille à voix haute, c'est le moyen le plus rapide de savoir si votre réponse tient face aux relances. Calibrd ajoute l'entraînement vocal avec un retour sur chaque réponse, et une simulation d'entretien complète : un tour en direct avec un intervieweur IA qui a lu le poste et votre CV, puis un débrief honnête.
- 01« Implémentez une attention multi-têtes from scratch en PyTorch, avec un masque causal. Déroulez chaque shape de tenseur au fur et à mesure, et dites où part la mémoire à 32k tokens. »La travailler →
- 02« Écrivez une boucle de training avec accumulation de gradient et gradient clipping. Où la précision mixte change-t-elle ce que vous avez écrit, et qu'est-ce qui casse en premier à l'échelle ? »La travailler →
- 03« Notre chiffre d'évaluation a bougé de deux points entre deux runs de même config. Listez ce que vous vérifieriez, dans l'ordre, et ce que coûte chaque vérification. »La travailler →
- 04« Designez le pipeline de données et de training d'un run de 7 milliards de paramètres sur 256 GPU. Couvrez le sharding, le checkpointing, les cibles de débit et ce que vous monitorez. »La travailler →
- 05« Designez un harnais d'évaluation auquel tout le lab peut ajouter des benchmarks. Comment gardez-vous les résultats comparables entre versions de modèle et formats de prompt ? »La travailler →
- 06« Servez un modèle de 70 milliards de paramètres aux chercheurs internes avec un budget de latence et un pool de GPU fixe. Batching, KV cache, quantization, et ce que vous sacrifiez. »La travailler →
- 07« Parlez-moi d'une expérience que vous avez conçue. Qu'est-ce que le résultat a changé, et qu'avez-vous lancé ensuite ? »La travailler →
- 08« Décrivez une fois où un chercheur voulait quelque chose que l'infrastructure ne savait pas encore faire. Qu'avez-vous construit, et qu'avez-vous refusé de construire ? »La travailler →
- 09« Pourquoi ce lab, et sur lequel de ses papiers récents auriez-vous voulu travailler ? »La travailler →
Ce sont les questions générales. Collez une vraie offre et Calibrd prédit celles que cette entreprise pose pour ce poste précis, puis vous interroge dessus.
Prédire mes questions →Benchmark de salaire
Rémunération typique · base, equity, bonusRémunération typique pour Research Engineer, chiffres principaux tels que le marché de référence les affiche. Quand le repère est le marché tech américain, comptez 30 à 50 % de moins en fixe à Paris, Berlin ou Singapour. La part d'equity varie beaucoup selon le stade de l'entreprise.
Levels.fyi pour Research Engineer chez OpenAI, lu le 11 septembre 2026 : médiane totale 880 k$, fourchette jusqu'à 1,08 M$, et le seul niveau documenté, L4, à 980 k$ composés de 380 k$ de fixe et 600 k$ par an en actions, vesting sur quatre ans à 25 % par an. L'annonce d'Anthropic pour un Research Engineer ou Scientist pre-training à Seattle affiche un salaire de 350 000 à 850 000 $. Les médianes des research scientists de Google DeepMind sont rapportées entre 336 et 406 k$ plus des actions Google. À Paris, Mistral et Hugging Face paient nettement au-dessus du marché avec un poids equity lourd, sans fourchette publiée pour ce titre. Les échantillons sont petits, l'equity est celle de sociétés privées pour deux labs sur trois, et les chiffres bougent chaque mois.
Comment se préparer
6 conseils tactiquesOuvrez vos réponses comportementales avec la méthode STAR : Situation, Tâche, Action, Résultat. Les conseils ci-dessous s'appuient sur cette structure pour ce rôle précis.
- 01Implémentez l'attention et un bloc Transformer de mémoire jusqu'à tenir en 25 minutes en narrant les shapes. C'est la question de coding par défaut, et les shapes de tenseurs sont la notation
- 02Répétez le round de papier sur un papier que vous n'avez pas écrit : contribution, méthode, preuves, limites, l'extension la moins chère. Deux ou trois jours de préavis, c'est ce qu'OpenAI donne
- 03Entraînez-vous à penser à voix haute sur des questions de recherche ouvertes avec un ami, 15 minutes d'affilée. Le round de brainstorm élimine ceux qui ont besoin de silence avant de parler
- 04Lisez « Deep Learning » de Goodfellow, Bengio et Courville pour le quiz de fondamentaux, et « The Art of Doing Science and Engineering » de Hamming pour ce que le research taste veut dire dans une pièce
- 05Préparez un projet à vous au niveau de chaque décision : pourquoi cette architecture, pourquoi ces données, ce que vous avez mesuré, ce que vous referiez. Le deep dive vise les décisions
- 06Dites pourquoi ce lab en parlant de ses travaux. Un licenciement explique pourquoi vous cherchez ; ce n'est pas une raison de vouloir ce loop, et la question de la mission est posée deux fois
Les pièges fréquents au niveau Research Engineer
À repérer en simulationQuelques erreurs fréquentes qui font recaler les candidats Research Engineer même quand ils sont par ailleurs solides. Mieux vaut les repérer en simulation avant qu'elles n'apparaissent en vrai.
Résoudre correctement le problème de coding en narrant de mauvaises shapes, ou aucune, et corriger le masque seulement quand l'intervieweur le pointe.
Pourquoi ça rate
Le round de coding ML note si l'on peut vous confier un run de training, et les erreurs de shape sont la façon dont les runs meurent à 3 heures du matin. Une sortie correcte avec un raisonnement de shapes silencieux dit à l'intervieweur que vous y êtes arrivé par tâtonnement, et un masking ou une contiguïté corrigés sur indice comptent contre vous plutôt que pour vous.
La réponse qui fait perdre
« Voilà la fonction d'attention, elle passe le cas de test. »
La réponse qui fait gagner
« Q est batch par têtes par séquence par dimension de tête, K transposé donne séquence par séquence pour chaque tête, je masque le triangle supérieur avec moins l'infini avant le softmax pour que le padding ne fuie pas, et à 32k tokens cette matrice de scores est le problème de mémoire, d'où un kernel fusionné. »
Comment rattraper
Dites chaque shape avant d'écrire la ligne qui la produit, de la dimension batch à la dimension par tête, et écrivez le masque et la garde numérique avant qu'on vous le demande. Traitez le code comme quelque chose qui tournera sur 256 GPU ce soir.
Se taire dans le brainstorm de recherche, ou sortir une seule idée léchée après un long silence au lieu de plusieurs idées brutes vite.
Pourquoi ça rate
Le round note le goût et la vitesse de la première idée, parce que c'est ce qu'un chercheur obtient de vous dans un couloir. Le récit d'un candidat sur un round Anthropic décrit trois minutes de silence, l'expression de l'intervieweur, et une élimination à cette étape malgré des rounds de coding réussis.
La réponse qui fait perdre
« Laissez-moi réfléchir un instant. [long silence] Je suppose qu'on pourrait essayer un modèle plus gros. »
La réponse qui fait gagner
« La première vérification bon marché, c'est de voir si l'effet survit à un changement de format de prompt, un après-midi sur l'éval existante. Si oui, la direction intéressante est de savoir si c'est un effet de données ou d'architecture, et je couperais les données de training avant de toucher à l'architecture. »
Comment rattraper
Commencez à parler dans la première minute avec l'idée évidente en disant pourquoi elle est évidente, puis améliorez-la à voix haute. Nommez l'expérience que vous lanceriez en premier parce qu'elle est bon marché, et le résultat qui vous ferait arrêter.
Présenter le round de papier comme un résumé et le deep dive de projet comme une histoire d'équipe.
Pourquoi ça rate
Les deux rounds existent pour savoir si vous savez juger de la recherche et si vous avez pris les décisions dans votre propre travail. Un résumé montre que vous avez lu ; le round veut les limites, la baseline manquante et l'extension que vous lanceriez. Un deep dive raconté en « nous » laisse l'intervieweur incapable de dire ce que vous avez fait, et dans les labs un recrutement doit passer la barre sur ce point précis.
La réponse qui fait perdre
« Le papier propose une variante d'attention et montre des améliorations sur trois benchmarks. »
La réponse qui fait gagner
« Le gain est réel sur les deux benchmarks à contexte long et dans le bruit sur le troisième, et la baseline n'a pas été tunée au même compute. L'extension que je lancerais en premier est la même comparaison à tokens égaux, une journée de compute, parce que si le gain y survit la méthode vaut d'être adoptée. »
Comment rattraper
Pour le papier, consacrez un tiers du temps à ce qu'il n'a pas montré et à une extension concrète. Pour votre projet, dites « je » pour chaque décision que vous avez portée, nommez celle que vous avez ratée, et dites ce que vous avez mesuré après l'avoir changée.
Répondre à « pourquoi ce lab » par le marché, la marque ou la paie, et traiter le round sécurité ou valeurs comme une formalité.
Pourquoi ça rate
Les intervieweurs des labs citent les mêmes motifs de refus : des candidats dédaigneux sur la sécurité, qui préfèrent travailler seuls, ou qui veulent l'offre pour l'argent. La question de la mission est posée au premier appel et à nouveau dans la dernière heure, et un décalage entre les deux réponses se remarque.
La réponse qui fait perdre
« Vous êtes le lab de référence et la rémunération est compétitive, et je veux travailler sur des modèles de frontière. »
La réponse qui fait gagner
« Vos travaux d'interprétabilité sur l'attribution de features ont changé ma façon de lire mes propres évals, et j'ai un avis sur là où ça casse à l'échelle. Je veux construire le tooling qui rend ce type de travail routinier plutôt qu'héroïque. »
Comment rattraper
Nommez les travaux récents du lab dont vous auriez voulu faire partie et dites ce que vous feriez autrement. Sur la sécurité, apportez une opinion et un arbitrage que vous avez fait, et laissez l'intervieweur ne pas être d'accord.
Ressources recommandées
Sans lien d'affiliationLivres, cours et outils qui reviennent le plus dans la préparation Research Engineer.
- 01Deep Learning (Goodfellow, Bengio, Courville) →
Les fondamentaux que le quiz DeepMind et les rounds ML d'OpenAI supposent acquis. Gratuit en ligne. Chapitres 6 à 10 avant tout loop de lab.
- 02The Art of Doing Science and Engineering (Richard Hamming) →
Le livre derrière le round de research taste : comment choisir des problèmes qui valent le travail et distinguer une direction prometteuse d'une impasse.
- 03Sundeep Teki, guide d'entretien AI Research Engineer : OpenAI, Anthropic, DeepMind →
Le compte rendu public le plus précis des trois loops : le loop final de 4 à 6 heures, le papier envoyé 2 à 3 jours avant, la porte CodeSignal et le quiz.
- 04Designing Machine Learning Systems (Chip Huyen) →
Pour le round systèmes de training et de serving. Les chapitres données et pipelines se transposent directement aux questions d'infrastructure d'un lab.
- 05Anthropic, consignes sur l'usage de l'IA par les candidats →
Liée depuis chaque annonce Anthropic : Claude pour préparer et polir une candidature, rien en entretien en direct, et pas d'IA sur un take-home sauf mention contraire.
Scénarios courants
Situations qui reviennent souventJe suis backend senior avec 6 ans d'expérience et sans passé en recherche ML. Un poste de Research Engineer dans un frontier lab est-il accessible ?
Oui, et l'annonce le dit : la fiche Research Engineer pre-training d'Anthropic demande une expérience solide en software engineering et quelqu'un qui a envie d'apprendre la recherche ML, dans cet ordre. Ce que vous ne pouvez pas sauter, c'est le round de coding ML. Passez huit à douze semaines à implémenter l'attention, un bloc Transformer, une boucle de training avec clipping et accumulation, et un data loader qui streame, jusqu'à ce que les shapes sortent de votre bouche avant le code. Lisez Goodfellow pour les fondamentaux qu'un quiz vérifiera. Au round systèmes, vous êtes le candidat fort : training distribué, checkpointing, débit et fiabilité sont votre terrain, donc menez avec le plus gros système que vous avez maintenu en vie. Pour le round de papier, prenez trois papiers récents du lab et répétez à voix haute la structure contribution, limites, extension. Racontez-vous comme l'ingénieur qui rend les runs de recherche ennuyeux et reproductibles, et dites pourquoi ce lab en parlant de ses travaux. Mistral, Kyutai et Hugging Face à Paris tiennent la même barre.
J'ai un doctorat en ML et je candidate en Research Engineer plutôt qu'en Research Scientist. Qu'est-ce qui change dans le loop, et est-ce un pas en arrière ?
C'est un autre métier, et dans les labs les grilles se recouvrent. Ce qui change, c'est l'endroit où se trouve la barre. Les rounds de coding sont plus lourds et notés sur la qualité production : du code propre qui marche sous contrainte de temps au screen, puis du code d'architecture de mémoire où les shapes et la mémoire sont la notation. Le round de papier est plus facile pour vous que pour n'importe qui, donc n'y passez pas votre prep. Passez-la sur le round systèmes, qui demande comment un run de 7 milliards de paramètres survit sur 256 GPU, et sur l'écriture de code hors notebook : classes, tests, un script de training qui redémarre d'un checkpoint. Dans le deep dive de projet, décrivez l'ingénierie que vous avez faite sur votre propre code de thèse, ce qui a cassé et ce que vous avez reconstruit, parce que c'est la preuve dont le titre a besoin. Dites clairement pourquoi vous voulez construire les systèmes plutôt que mener la recherche, et pensez-le ; le round valeurs l'écoute.
Comment préparer le loop Research Engineer d'Anthropic précisément, avec le test CodeSignal et le take-home ?
Traitez la porte CodeSignal comme un examen à part : 90 minutes, une classe exposant une API publique construite en quatre niveaux, et les candidats rapportent que finir chaque niveau avec des tests qui passent compte plus que la complexité optimale. Entraînez-vous sur des problèmes chronométrés qui grossissent par étapes. Le loop qui suit dure environ 20 jours : un round de coding en direct que les candidats décrivent comme un problème medium avec une variante, un deep dive de projet qui vise vos décisions, un brainstorm de recherche avec un lead où la première idée doit venir vite, un take-home d'environ cinq heures dans une fenêtre de 48 heures sans assistance IA, et une conversation valeurs. Les prises de références se font pendant le process, donc prévenez vos références tôt. Lisez les consignes d'Anthropic sur l'IA avant de commencer : Claude pour préparer et polir, rien en round en direct, rien sur le take-home sauf mention contraire. Apportez une opinion sur la sécurité avec un arbitrage que vous avez fait ; une réponse dédaigneuse à cet endroit met fin au process.
J'ai résolu toutes les questions de coding à deux onsites de labs et j'ai été refusé aux deux sans retour. Qu'est-ce qui a raté ?
Presque certainement pas le code. Les récits de candidats dans la même situation en 2026 pointent les deux mêmes rounds : le deep dive de projet et la conversation de recherche ou de valeurs. Passer les rounds techniques est le prix d'entrée dans les labs ; la décision se prend sur votre jugement en recherche et sur le fait d'avoir porté les décisions dans votre propre travail. Trois vérifications. Votre histoire de projet disait-elle « je » pour les décisions et nommait-elle celle que vous avez ratée ? Avez-vous commencé à parler dans la première minute du brainstorm en améliorant l'idée à voix haute, ou attendu une réponse finie ? Votre « pourquoi ce lab » nommait-il leurs travaux, et votre réponse sur la sécurité portait-elle un arbitrage plutôt qu'un acquiescement ? Corrigez ces trois points et recandidatez après la période de carence, généralement plusieurs mois. La prochaine fois, demandez au recruteur après le loop quel round posait problème ; certains le disent.
Questions fréquentes
Je suis actuellement MLE (L4 / IC3). Dois-je lire ce guide ou celui de MLE en premier ?
Lisez d'abord le guide MLE. Les entreprises calibrent les candidats IC4 / IC5 · L4 en lab contre la barre L4 / IC3, en ciblant clairement l'écart de scope, elles veulent voir où vous êtes aujourd'hui, puis creuser le gap jusqu'au IC4 / IC5 · L4 en lab. Lisez ce guide APRÈS avoir compris la baseline L4 / IC3, comme ça vous saurez exactement quels signaux démontrer pour le step-up.
Combien de temps prévoir avant un onsite Research Engineer ?
Le loop dure trois à huit semaines selon le lab. Ajoutez huit semaines de prep : l'attention et le Transformer de mémoire en narrant les shapes, un papier par semaine présenté à voix haute avec ses limites et une extension, et des reps de brainstorm de 15 minutes avec un ami. Le coding est le prix d'entrée ; le papier et le brainstorm décident.
Quelle est l'erreur la plus fréquente des candidats au niveau Research Engineer ?
Préparer un loop MLE de boîte produit. Le grind LeetCode n'achète rien ici, et les rounds qui décident sont la discussion de papier, le brainstorm et la conversation valeurs, où des candidats ayant résolu toutes les questions de coding rapportent encore des refus.
Et si mon process d'entretien diffère de celui décrit ici ?
L'essentiel de la variation est marginal. Les grandes boîtes tech (FAANG, scale-ups, SaaS mid-size) suivent un process à 1–2 rounds près de ce qui est décrit. Les petites startups tournent souvent sur moins de rounds (3 à 4) mais la barre par round reste similaire ; les boîtes moins matures tech sautent parfois system design ou comportemental. Lisez l'offre et demandez au recruteur lors du pré-screen, il vous dira ce qui vient.
Comment ce guide se compare-t-il au scan gratuit ?
Ce guide couvre la barre générale au niveau IC4 / IC5 · L4 en lab. Le scan gratuit lit votre offre d'emploi spécifique et renvoie les questions prédites pour ce poste + cette entreprise, un benchmark de salaire ajusté au poste et, avec votre CV, une lecture de vos écarts d'expérience et un passage ATS de CV, envoyés en PDF.
Passez à votre vraie offre
Collez n'importe quelle offre Research Engineer, découvrez votre coach en moins de 30 secondes.
Déposez une URL LinkedIn, Greenhouse, Lever ou Levels.fyi, ou collez le texte de l'offre. Votre coach prédit les questions pour cette entreprise, fait ressortir vos écarts d'expérience, et calibre un benchmark de salaire pour le poste et la localisation. PDF par e-mail. Ensuite, répétez le tour à voix haute avec un retour honnête jusqu'à être prêt.
Gratuit pour commencer · Sans carte · CV chiffré, supprimable à tout moment