Mise à jour 2026
Quelques choses ont changé en France en 2026. L'AI Act encadre le recrutement par IA depuis le 2 août, 31 % des candidats utilisent déjà l'IA pour se préparer (APEC), les mises en situation remplacent les tests classiques, et le cycle de recrutement reste à 12 semaines. Lire ce qui a changé en 2026 →
Ce qui sera attendu de vous
Ce qu'ils notent- Porter une direction de recherche : choisir le problème, concevoir les expériences, décider quand un résultat est réel
- Publier en premier auteur à NeurIPS, ICML, ICLR ou la conférence de référence de votre domaine
- Implémenter vos propres idées en PyTorch ou JAX et les faire tourner à l'échelle du lab
- Lire le domaine de près et rapporter ce qui change le plan du lab, à l'écrit et en reading group
- Raisonner sur la sûreté, l'évaluation et les modes de défaillance des modèles que vous entraînez, pas seulement sur leurs benchmarks
- Travailler avec les research engineers sur l'infrastructure et avec les équipes produit quand un résultat est prêt à être livré
Process d'entretien, round par round
7 rounds · 4 à 8 semaines, plus 2 à 4 de team matchingLa plupart des entreprises suivent une trame similaire pour les entretiens Research Scientist. Délai calendaire total : 4 à 8 semaines, plus 2 à 4 de team matching du pré-screen recruteur jusqu'à l'offre.
Parcours de recherche, publications, l'équipe et le sujet que vous visez, et pourquoi ce lab. Chez Anthropic, le recruteur sonde déjà votre regard sur la recherche en sûreté
Ce qui est noté
- Un récit de recherche cohérent plutôt qu'une liste de papiers
- Une raison de choisir ce lab qui nomme ses travaux
Des problèmes pratiques plutôt que des puzzles : un cache LRU, un rate limiter, ou un exercice NumPy et PyTorch en plusieurs parties. Le CodeSignal d'Anthropic enchaîne quatre niveaux progressifs et note sur la correction complète ; beaucoup de chercheurs solides tombent ici
Ce qui est noté
- Du code qui marche, vite, avec des tests
- NumPy et PyTorch sans rien chercher
Un projet à vous : motivation, le trou dans l'état de l'art, vos décisions de design, les résultats avec ablations et résultats négatifs, les limites. Les intervieweurs coupent sur les décisions et insistent sur les faiblesses
Ce qui est noté
- Chaque choix défendu avec les alternatives écartées
- Les limites nommées avant que l'intervieweur ne les trouve
Chez OpenAI, un papier arrive deux ou trois jours avant l'onsite : idée, méthode, résultats, limites, et le lien avec vos propres travaux. Chez DeepMind, le papier peut être l'un des vôtres ou un que vous connaissez à fond, avec des intervieweurs différents pour tester plusieurs sous-domaines
Ce qui est noté
- Une critique qui dépasse l'abstract pour atteindre le design expérimental
- Ce que vous lanceriez ensuite, et pourquoi
Implémenter un algorithme from scratch sans référence (k-means, une cellule LSTM, une variante d'attention), ou réparer un réseau qui tourne mais n'apprend pas : erreurs de broadcasting, softmax sur la mauvaise dimension, mauvaises entrées dans la loss
Ce qui est noté
- Des bugs trouvés en raisonnant sur les shapes des tenseurs, pas par tâtonnement
- Du code propre sous contrainte de temps
DeepMind pose à voix haute des questions de niveau licence : le rang d'une matrice, L1 contre L2, le gradient de la régression logistique. La plupart des labs ajoutent une session sur un problème ouvert où vous proposez expériences, métriques, un angle théorique et un moyen de réfuter votre propre hypothèse
Ce qui est noté
- Définitions et dérivations de mémoire
- Un plan qui peut échouer, et savoir comment vous le verriez
Le round sûreté d'Anthropic est une conversation : les meilleurs arguments contre la Constitutional AI, ce que vous faites quand un modèle se comporte différemment en évaluation et en déploiement. Ailleurs, mission et collaboration passent dans les rounds comportementaux
Ce qui est noté
- La sûreté traitée comme un problème de recherche auquel vous avez réfléchi
- Des désaccords avec des collaborateurs racontés avec leur issue
Research Scientist tourne sur 7 rounds. Pour voir où se situe chaque rôle, ouvrez le rapport entretiens tech 2026.
Questions types à anticiper
9 questions qui décidentReprésentatives de ce que les entreprises demandent à ce niveau. Chaque question ici se travaille à voix haute, c'est le moyen le plus rapide de savoir si votre réponse tient face aux relances. Calibrd ajoute l'entraînement vocal avec un retour sur chaque réponse, et une simulation d'entretien complète : un tour en direct avec un intervieweur IA qui a lu le poste et votre CV, puis un débrief honnête.
- 01« Voici un script d'entraînement qui tourne sans erreur mais dont la loss ne descend jamais sous sa valeur de départ. Trouvez le bug et dites-moi comment vous l'avez trouvé. »La travailler →
- 02« Implémentez une attention scaled dot-product en NumPy, puis dites-moi ce qui change en multi-head, et quel est le coût mémoire à une longueur de séquence de 32k. »La travailler →
- 03« Quel est le rang de cette matrice, et pourquoi cela compte pour l'adaptateur low-rank que vous entraîneriez par-dessus un modèle gelé ? »La travailler →
- 04« Nous pensons que les performances de notre modèle en long contexte sont limitées par l'encodage de position. Concevez les expériences qui le confirmeraient ou l'infirmeraient en deux semaines de calcul. »La travailler →
- 05« Un papier annonce 4 points de gain sur un benchmark. Avant d'adopter la méthode, que lanceriez-vous pour décider si le gain est réel ? »La travailler →
- 06« Proposez une évaluation pour savoir si un modèle se comporte différemment quand il peut deviner qu'il est testé. Qu'est-ce qui compterait comme preuve dans un sens ou dans l'autre ? »La travailler →
- 07« Déroulez la décision de recherche de votre talk dont vous êtes le moins sûr, et ce que vous feriez autrement aujourd'hui. »La travailler →
- 08« Parlez-moi d'un résultat qui ne s'est pas répliqué. Qu'avez-vous fait, et à qui l'avez-vous dit ? »La travailler →
- 09« Pourquoi ce lab, et quel problème ici voudriez-vous porter la première année ? »La travailler →
Ce sont les questions générales. Collez une vraie offre et Calibrd prédit celles que cette entreprise pose pour ce poste précis, puis vous interroge dessus.
Prédire mes questions →Benchmark de salaire
Rémunération typique · base, equity, bonusRémunération typique pour Research Scientist, chiffres principaux tels que le marché de référence les affiche. Quand le repère est le marché tech américain, comptez 30 à 50 % de moins en fixe à Paris, Berlin ou Singapour. La part d'equity varie beaucoup selon le stade de l'entreprise.
Levels.fyi, lu le 11 septembre 2026. OpenAI Research Scientist, médiane 800 k$ : L4 766 k$ (293 k$ de fixe, 473 k$ d'actions), L5 1,38 M$ (415 k$ de fixe, 968 k$ d'actions), sans bonus. Google Research Scientist, médiane 427 k$ : L5 511 k$ (230 k$ de fixe, 256 k$ d'actions, 25 k$ de bonus), L6 606 k$. Anthropic Research Scientist, médiane 425 k$ et un package maximal déclaré au-dessus de 892 k$ ; la page comptait trop peu de soumissions pour afficher les niveaux. Ces chiffres sont américains ; à Paris, Mistral, Kyutai et Meta FAIR Paris paient au-dessus du marché local avec une part d'actions dominante, sans grille publique fiable, donc demandez la fourchette au recruteur avant la première boucle.
Comment se préparer
6 conseils tactiquesOuvrez vos réponses comportementales avec la méthode STAR : Situation, Tâche, Action, Résultat. Les conseils ci-dessous s'appuient sur cette structure pour ce rôle précis.
- 01Construisez le research talk en premier et répétez-le sous interruption. Vingt-cinq minutes de slides sur un seul projet : motivation, trou, décisions de design, ablations, résultats négatifs, limites. Demandez à un collègue de vous couper toutes les deux minutes avec « pourquoi pas l'autre option »
- 02Réapprenez les mathématiques de licence à voix haute. Rang, valeurs propres, gradient de la régression logistique, divergence KL, pourquoi L1 donne de la parcimonie. DeepMind les demande à l'oral et rejette les chercheurs qui ne répondent pas de mémoire
- 03Écrivez du NumPy et du PyTorch from scratch au chronomètre : attention, cellule LSTM, k-means, boucle d'entraînement. Puis entraînez-vous à débugger un réseau qui tourne mais n'apprend pas, parce que ce round existe et que personne ne le prépare
- 04Lisez cinq à dix papiers récents de votre domaine assez à fond pour critiquer le design expérimental, et préparez-vous à recevoir un papier deux ou trois jours avant un onsite
- 05Préparez une réponse sur la sûreté même si vos travaux n'en relèvent pas. Anthropic y consacre un round de 45 minutes, et le candidat brillant qui balaie la question est le refus que tous les labs décrivent
- 06Lisez « The Art of Doing Science and Engineering » de Hamming pour la conversation sur le goût de recherche : quels problèmes valent le coup, et pourquoi vous avez choisi le vôtre
Les pièges fréquents au niveau Research Scientist
À repérer en simulationQuelques erreurs fréquentes qui font recaler les candidats Research Scientist même quand ils sont par ailleurs solides. Mieux vaut les repérer en simulation avant qu'elles n'apparaissent en vrai.
Présenter le research talk comme une visite guidée des résultats, puis se braquer quand un intervieweur appuie sur une faiblesse connue.
Pourquoi ça rate
Le talk note votre capacité à défendre vos choix de recherche sous pression tout en restant ouvert aux alternatives. Tous les labs décrivent le même refus : un dossier solide, et un candidat qui a contesté la limite au lieu de l'assumer. L'intervieweur connaît déjà la faiblesse ; le round teste ce que vous faites quand elle est nommée.
La réponse qui fait perdre
« On a essayé et ça marchait moins bien, donc c'est la bonne approche pour ce cadre. »
La réponse qui fait gagner
« C'est le point le plus faible. On n'a comparé à la baseline linéaire qu'à une seule échelle ; à 7B l'écart pourrait se refermer, et l'expérience de deux semaines qui le dirait est un balayage sur la taille de modèle à données constantes. Si l'écart se referme, la contribution est le pipeline de données, pas l'architecture. »
Comment rattraper
Mettez les limites sur leur propre slide avant qu'on vous les demande, et pour chaque décision de design, nommez l'alternative écartée et la preuve qui a tranché. Quand on insiste, accordez ce qui est vrai, puis dites ce que vous lanceriez pour trancher.
Traiter les rounds de coding comme une formalité parce que le poste est en recherche.
Pourquoi ça rate
OpenAI décrit ses scientifiques comme des gens qui transforment vite une idée en code qui marche, le CodeSignal d'Anthropic note sur la correction complète de quatre niveaux, et DeepMind fait passer un round d'implémentation et un round de debugging. La barre est sous celle du loop d'ingénieur, et elle élimine quand même beaucoup de chercheurs solides.
La réponse qui fait perdre
« D'habitude je vérifierais les règles exactes de broadcasting, mais en gros la dimension batch vient en premier. »
La réponse qui fait gagner
« Les logits sont batch par vocab, les cibles sont batch, donc la loss attend des indices de classe, et le bug est qu'on lui passe des cibles one-hot. Une fois corrigé, le softmax du modèle est appliqué sur la dimension 0, c'est-à-dire le batch, donc il normalise entre exemples ; il devrait l'être sur la dernière dimension. »
Comment rattraper
Deux semaines de pratique chronométrée : des problèmes pratiques (un cache, un rate limiter), des implémentations from scratch de l'attention et d'une boucle d'entraînement, et le debugging d'un script qui tourne mais n'apprend pas. Dites vos shapes de tenseurs à voix haute en codant.
Répondre au quiz de fondamentaux avec de l'intuition quand on vous demandait une définition, des années après en avoir eu besoin.
Pourquoi ça rate
Le quiz oral de DeepMind demande des définitions formelles et des dérivations de niveau licence, et ses intervieweurs disent que les candidats en industrie depuis des années les ont oubliées et échouent sur ce seul point. Le round filtre le raisonnement sans aide, et aucune assistance IA n'est autorisée.
La réponse qui fait perdre
« L1 a tendance à pousser certains poids à zéro, L2 les garde petits ; L1 fait plutôt de la sélection de features. »
La réponse qui fait gagner
« L1 ajoute lambda fois la somme des valeurs absolues des poids, dont le sous-gradient est de norme constante, donc la pénalité continue de pousser les petits poids exactement à zéro ; L2 ajoute lambda fois la norme au carré, dont le gradient décroît avec le poids, donc les poids tendent vers zéro sans l'atteindre. Géométriquement, la boule L1 a des coins sur les axes, et c'est là que le contour de la loss la touche en premier. »
Comment rattraper
Passez une semaine sur Mathematics for Machine Learning et dérivez à la main : les gradients de la régression logistique et d'un réseau à deux couches, la décomposition biais-variance, la KL entre deux gaussiennes, le théorème du rang. Dites d'abord la définition, puis l'intuition.
Donner une réponse générique à « pourquoi ce lab », ou balayer le round sûreté comme une formalité.
Pourquoi ça rate
Les labs sélectionnent des gens qui veulent leurs problèmes précis. Les candidats d'Anthropic décrivent le round sûreté comme celui qui décide, et le lab nomme le mélange de brillance technique et de mépris pour la sûreté comme l'erreur qu'il veut le plus éviter. OpenAI et DeepMind glissent la même question dans les rounds comportementaux et avec les team leads.
La réponse qui fait perdre
« Je veux travailler à la frontière et c'est ici que les meilleurs modèles se construisent. »
La réponse qui fait gagner
« Les travaux de votre équipe interprétabilité sur l'attribution de features s'arrêtent au residual stream, et la méthode de probing causal de ma thèse permet de tester si ces features pilotent le comportement plutôt que d'y être corrélées. La première expérience que je proposerais est une ablation sur les features que votre papier signale comme liées à la sûreté. »
Comment rattraper
Nommez un papier ou une équipe du lab et la question ouverte que vous y prendriez. Pour la sûreté, préparez une position réfléchie sur une méthode réelle, par exemple les meilleurs arguments contre la Constitutional AI, et ce que vous feriez si un modèle se comportait différemment en évaluation et en déploiement.
Ressources recommandées
Sans lien d'affiliationLivres, cours et outils qui reviennent le plus dans la préparation Research Scientist.
- 01The Art of Doing Science and Engineering (Richard Hamming) →
Le livre de référence sur le goût de recherche : quels problèmes valent le coup et pourquoi. La barre derrière les rounds de jugement de recherche et de « pourquoi ce lab ».
- 02Mathematics for Machine Learning (Deisenroth, Faisal, Ong) →
Gratuit. Algèbre linéaire, probabilités et optimisation à la profondeur du quiz oral de fondamentaux.
- 03Deep Learning (Goodfellow, Bengio, Courville) →
Gratuit. Chapitres 5 à 9 pour les dérivations et le round d'implémentation from scratch.
- 04AI Research Scientist Interview Guide, Sundeep Teki (2026) →
Les loops d'Anthropic, OpenAI et DeepMind round par round, dont le CodeSignal, le papier envoyé à l'avance et le quiz oral.
- 05Google DeepMind interview process 2026, TechInterview →
Les cinq composantes de l'onsite du track recherche, les deux ou trois discussions de papier, et l'interdiction des outils IA dans les rounds techniques.
- 06Levels.fyi, Research Scientist chez OpenAI, Google et Anthropic →
Les chiffres de rémunération de cette page, lus le 11 septembre 2026. Consultez les pages Google et Anthropic pour le même titre avant de négocier.
Scénarios courants
Situations qui reviennent souventMa thèse est en vision par ordinateur et les labs recrutent sur les modèles de langage. Est-ce que je passe en research scientist, et comment je cadre le talk ?
Vous passez, et c'est le talk qui referme l'écart de domaine ou pas. Les labs notent le talk sur le jugement de recherche : motivation, trou, décisions de design, ablations faites et ablations qui manquent. Tout cela se transfère tel quel de la vision au langage. Ce qui ne se transfère pas, c'est la discussion de papier et la session sur problème ouvert, où l'intervieweur vous tend une question sur les modèles de langage et vous regarde raisonner. Passez les semaines avant l'onsite à lire cinq à dix papiers LLM récents assez à fond pour critiquer le design expérimental, et choisissez le projet du talk pour ses décisions plutôt que pour sa modalité. Dans la réponse « pourquoi ce lab », nommez un problème de langage du lab auquel votre méthode parle, une technique de probing ou d'évaluation par exemple, et proposez la première expérience. Un chercheur en vision qui arrive avec une expérience LLM concrète en main passe pour un chercheur ; celui qui arrive avec un talk de vision et sans passerelle passe pour un candidat en reconversion.
Je suis ML engineer avec six ans en industrie et sans doctorat. Puis-je décrocher une offre de research scientist dans un frontier lab, ou dois-je postuler en research engineer ?
Postulez en research engineer, sauf si vous avez des papiers en premier auteur dans les grandes conférences. Le track research scientist de DeepMind exige un doctorat dans les faits, et les rounds de talk et de papier de tous les labs supposent un dossier de publications à interroger ; sans lui, le loop n'a rien à noter. Le loop de research engineer des mêmes labs est celui où votre profil gagne : la barre de coding est plus haute, les rounds d'implémentation et de debugging sont le centre, et les rounds de recherche demandent si vous savez bien faire tourner l'idée d'un autre plutôt que d'en produire une. La rémunération dans les labs est proche entre les deux titres à niveau égal. Si vous voulez le titre de scientist plus tard, la voie qui marche est de publier de l'intérieur : les research engineers de ces labs cosignent, et un papier en premier auteur issu d'une équipe du lab est la référence que le loop de scientist attend. Préparez le loop d'ingénieur avec le guide research engineer, et gardez de celui-ci le récit de projet façon talk, parce que les mêmes intervieweurs posent les deux.
J'ai soutenu ma thèse il y a cinq ans et je suis en industrie depuis. Comment je prépare le quiz de fondamentaux de DeepMind sans retourner à l'université ?
Deux semaines de dérivation délibérée, à voix haute. Le quiz est oral, de niveau licence et sans aide, et les intervieweurs de DeepMind disent eux-mêmes que les candidats sortis de la recherche depuis des années échouent sur des définitions formelles qu'ils connaissaient. Travaillez Mathematics for Machine Learning avec un carnet et un chronomètre : le théorème du rang, la décomposition en valeurs propres et son rôle dans la PCA, le gradient de la régression logistique et d'un réseau à deux couches à la main, la décomposition biais-variance, la KL entre deux gaussiennes, pourquoi L1 donne de la parcimonie avec l'argument du sous-gradient. Pour chacun, entraînez-vous à dire la définition d'abord et l'intuition ensuite, parce que le round récompense la définition puis demande l'image. Couplez-le au round de debugging, qui teste lui aussi ce que vous avez retenu plutôt que ce que vous savez chercher : un script qui tourne mais n'apprend pas, et les trois ou quatre bugs qui provoquent ça. Cinq ans d'industrie vous donnent le talk et les rounds de jugement ; le quiz est le seul endroit où l'expérience joue contre vous.
Mes travaux n'ont rien à voir avec la sûreté. Comment je gère le round sûreté d'Anthropic, et OpenAI ou DeepMind en ont-ils un ?
Celui d'Anthropic dure 45 minutes, en conversation, et les candidats le décrivent comme celui qui décide. Il ne teste pas un dossier de publications en sûreté ; il teste si vous avez réfléchi au problème en chercheur. Préparez deux positions réfléchies : les meilleurs arguments contre la Constitutional AI comme méthode, avec les preuves qui trancheraient, et ce que vous feriez si un modèle se comportait différemment en évaluation et en déploiement. Reliez-en une à vos propres travaux, par exemple comment votre méthode d'évaluation détecterait cet écart. L'échec que le lab nomme, c'est le candidat brillant qui traite la question comme une formalité. OpenAI n'a pas de round dédié et glisse l'alignement dans les discussions de recherche et les rounds comportementaux ; DeepMind met mission et valeurs dans le round final avec les team leads. Les deux mêmes positions préparées servent aux trois, et chez OpenAI et DeepMind la question arrive plutôt sous la forme « en quoi cela changerait ce que vous construiriez » que comme une heure à part.
Questions fréquentes
Ce guide vise-t-il seulement les postes de research scientist des frontier labs, ou aussi les labs appliqués et les groupes de recherche des grands groupes tech ?
Le loop décrit ici est celui des frontier labs (OpenAI, Anthropic, Google DeepMind), avec les différences entre eux nommées round par round. Meta FAIR, Microsoft Research et les labs appliqués comme Mistral suivent la même colonne vertébrale, un research talk, une discussion de papier approfondie et du coding, Meta ajoutant deux problèmes façon LeetCode par session de coding de 45 minutes et un round de ML system design, Microsoft Research penchant davantage vers le dossier de publications et le talk. Les chiffres de rémunération sont ceux des trois frontier labs ; les groupes de recherche des grands groupes suivent la grille d'ingénierie de leur entreprise.
Combien de temps prévoir avant un onsite Research Scientist ?
Le process prend quatre à huit semaines, et le team matching peut ajouter un mois. Consacrez les deux premières semaines de prep au research talk et répétez-le sous interruption ; consacrez les deux suivantes aux fondamentaux et au coding from scratch, parce que ce sont les rounds qui éliminent les chercheurs solides.
Quelle est l'erreur la plus fréquente des candidats au niveau Research Scientist ?
Préparer le talk et rien d'autre. Le talk est là où un bon dossier se voit, et les refus viennent des rounds autour : un CodeSignal raté sur la correction, un quiz oral de mathématiques de licence répondu à l'intuition, une question de sûreté traitée comme une formalité, et une limite connue défendue au lieu d'être assumée.
Et si mon process d'entretien diffère de celui décrit ici ?
L'essentiel de la variation est marginal. Les grandes boîtes tech (FAANG, scale-ups, SaaS mid-size) suivent un process à 1–2 rounds près de ce qui est décrit. Les petites startups tournent souvent sur moins de rounds (3 à 4) mais la barre par round reste similaire ; les boîtes moins matures tech sautent parfois system design ou comportemental. Lisez l'offre et demandez au recruteur lors du pré-screen, il vous dira ce qui vient.
Comment ce guide se compare-t-il au scan gratuit ?
Ce guide couvre la barre générale au niveau L5 / IC4 équivalent (RS de lab). Le scan gratuit lit votre offre d'emploi spécifique et renvoie les questions prédites pour ce poste + cette entreprise, un benchmark de salaire ajusté au poste et, avec votre CV, une lecture de vos écarts d'expérience et un passage ATS de CV, envoyés en PDF.
Passez à votre vraie offre
Collez n'importe quelle offre Research Scientist, découvrez votre coach en moins de 30 secondes.
Déposez une URL LinkedIn, Greenhouse, Lever ou Levels.fyi, ou collez le texte de l'offre. Votre coach prédit les questions pour cette entreprise, fait ressortir vos écarts d'expérience, et calibre un benchmark de salaire pour le poste et la localisation. PDF par e-mail. Ensuite, répétez le tour à voix haute avec un retour honnête jusqu'à être prêt.
Gratuit pour commencer · Sans carte · CV chiffré, supprimable à tout moment