Le nouveau recruteur IA de HackerRank laisse les candidats utiliser l'IA, puis demande ce qu'ils ont changé dans son code

Le lundi 5 octobre, HackerRank a rendu Chakra disponible à tous ses clients. Selon TechCrunch, le recruteur IA est resté environ six mois en bêta et a mené plus de 500 000 entretiens, avec Snowflake, Snorkel et Capgemini parmi les entreprises qui l'ont essayé.
Chakra ne lit pas des questions dans une liste. Il ouvre un espace de travail avec un vrai dépôt de code et un assistant IA, regarde le candidat travailler, puis lui demande pourquoi il a fait ce qu'il a fait. Le CEO de HackerRank, Vivek Ravisankar, a résumé le raisonnement en une phrase à TechCrunch : « La modalité d'évaluation précédente évaluait le résultat. Maintenant, à cause de l'IA, n'importe qui peut produire un artefact. »
Je suis des deux côtés de cette table. En tant que développeur freelance, je passe des tests techniques pour décrocher des missions. En tant que CTO de CBlindspot, une LegalTech que je construis sur Claude, je décide qui nous rejoint. Alors j'ai lu au-delà de l'article de lancement, jusque dans la documentation que HackerRank a écrite pour chaque camp.
À quoi ressemble l'entretien
L'équipe de recrutement commence par un plan d'entretien généré à partir d'une description de poste : des sections, des sujets, des critères pour une bonne réponse. Chaque candidat au poste reçoit le même plan. Chakra peut reformuler et relancer, mais la barre ne bouge pas.
La partie pratique prend deux formes : une question de code résolue sans IA, ou une question assistée par IA dans ce que HackerRank appelle un « Agentic Development Environment », où l'on planifie, construit et relit avec un assistant. La démo sur la page produit montre le second type : une application fictive appelée Shipway, un dossier de tickets de bugs, un chrono de 30 minutes, et la consigne d'écrire un PLAN.md avant de toucher au code, couvrant chaque problème, l'approche, les critères d'acceptation et les risques.
Pendant la construction, Chakra reste surtout silencieux, et le guide du candidat précise que le silence n'est pas pénalisé. Le vrai entretien commence après Submit. Les questions de suivi portent sur la façon dont tu as cadré les exigences, pourquoi tu as pris les décisions clés, ce que tu as relu, contesté ou changé dans la sortie de l'assistant, comment tu as validé le résultat, et comment ta solution changerait si une contrainte importante changeait.
Ravisankar a dit à TechCrunch que cette seule session remplace trois étapes : un premier échange avec un recruteur, un exercice à faire à la maison et un entretien de suivi avec un ingénieur.
Comment il note
HackerRank décrit trois agents : un transforme la description de poste en plan, un mène l'entretien en direct, et un Reporter lit toute la transcription ensuite et note chaque attente séparément. L'échelle est 3 pour atteint, 2 pour partiellement atteint, 1 pour non atteint, et 0 pour « Not Assessed » : « S'il n'y a aucun moment pertinent, l'attente n'est pas notée du tout. » Les notes sont ensuite normalisées de 0 à 5 pour le recruteur. Une bonne réponse dans un domaine ne compense pas une faible ailleurs.
Pour la partie pratique, trois éléments sont notés séparément. La solution, sur l'exhaustivité, les causes racines, les cas limites et les régressions (les tests échoués et les tentatives précédentes ne comptent pas contre toi). La discussion de suivi, sur la clarté avec laquelle tu défends ton travail. Et la maîtrise de l'IA : comment tu cadres la tâche et ses contraintes, avec quelle délibération tu guides l'assistant, avec quel soin tu relis, testes et corriges sa sortie. Ce dernier score lit à la fois tes échanges avec l'assistant et tes actions dans l'éditeur, comme le lancement de tests.
Le rapport d'exemple sur la page produit donne à un candidat 4,1 en « Agentic Coding », puis explique : « Dans l'ensemble, c'était du vibe-coding passif : le résultat est plausible, mais le candidat n'a pas montré qu'il comprenait ou pouvait défendre ce qu'il a accepté ». Le candidat « s'est appuyé sur "i trusted the AI" ». Cette phrase, c'est toute la thèse du produit.
Le choix que je respecte le plus est « Not Assessed ». J'utilise un petit modèle juge pour des décisions oui/non dans mes propres systèmes, et un score ne vaut que les preuves qui sont derrière.
La triche, retournée
Autoriser l'IA devrait faciliter la triche. HackerRank dit l'inverse : les signalements d'activité suspecte étaient inférieurs de 70 à 80 % à ceux des évaluations HackerRank traditionnelles comparables, selon la géographie et l'ancienneté. L'explication de Ravisankar : quand un assistant est fourni, on a moins de raisons d'en glisser un autre en douce.
Ce n'est pas un examen à livre ouvert. Le candidat partage son écran et sa webcam, travaille en plein écran sur un seul moniteur, et Chakra se met en pause s'il quitte le plein écran, branche un second écran ou sort du champ de la caméra. L'analyse de captures d'écran cherche des assistants IA externes ; la page produit nomme des applications comme Cluely, un appareil externe, ou ton « ami ». La règle est passée de « pas d'IA » à « notre IA, à la vue de tous ». C'est plus proche de ma façon de travailler au quotidien.
Ce qu'il ne voit pas
Le guide du candidat dit que Chakra « n'infère pas les compétences ou l'expérience dont tu ne parles pas ». C'est juste, mais le score mesure alors l'explication sous un chrono, dans une conversation vocale. Un développeur qui réfléchit bien mais raconte mal le paie, et peut-être aussi une personne dont ce n'est pas la langue maternelle, moi y compris. HackerRank dit tester la cohérence de la notation selon la formulation, le ton et la grammaire. Je vérifierais quand même sur mes propres candidats.
La cohérence n'est pas non plus la justesse. Une grille appliquée à l'identique à tout le monde applique aussi ses erreurs à l'identique, et c'est l'employeur qui écrit la grille. TechCrunch note que les outils de recrutement automatisés peuvent hériter de biais dans leurs données, leurs modèles et leurs critères.
Trente minutes dans un dépôt fictif ne montreront pas comment quelqu'un se comporte après trois semaines dans une base de code en désordre, quelle question il pose à un client avant d'écrire du code, ce qu'il décide de ne pas construire, ou comment il exprime un désaccord avec un collègue. Dans le récit de TechCrunch, Ravisankar lui-même laisse aux humains la question de savoir s'ils veulent vraiment travailler avec un candidat.
Les signaux d'intégrité sont aussi des probabilités. La version de juillet de HackerRank a ajouté la détection du regard, qui signale des détournements de regard répétés suivis de frappe comme un signal de gravité moyenne « pour que les équipes de recrutement puissent revoir plutôt que signaler automatiquement ». Les gens regardent ailleurs pour réfléchir. La documentation des rapports Chakra dit d'examiner les preuves avant de tirer des conclusions.
Ce que je m'entraînerais à faire en tant que candidat, dès lundi
Écrire le plan avant le code, avec des critères d'acceptation que tu pourrais vraiment tester. Quand l'assistant propose quelque chose, décider à voix haute, ou dans le plan, ce que tu gardes et ce que tu rejettes, parce que « qu'as-tu changé dans sa sortie ? » va arriver. Lancer tes tests là où on peut les voir. Répondre avec ton rôle, la décision, le compromis et le résultat mesuré ; le guide dit que des réponses plus longues ne notent pas plus haut. Dire « je ne sais pas » quand c'est vrai. Se préparer à « et si cette contrainte changeait ? ». Et débrancher le second moniteur.
Ce que je garderais humain côté recrutement
La grille, d'abord. La version de juillet permet de marquer des exigences indispensables qui pèsent plus dans le score, donc les choisir est une décision, pas un réglage.
L'étalonnage, ensuite. HackerRank dit n'utiliser un modèle de notation qu'une fois l'accord entre experts humains et IA au-dessus d'un « certain niveau », sans donner ce niveau sur cette page. Vérifiez-le vous-mêmes lundi : faites noter à l'aveugle une poignée de sessions enregistrées par deux ingénieurs, puis comparez avec Chakra.
Chaque signal d'intégrité, relu par une personne avant qu'il ne coûte un emploi à quelqu'un. Et la question des données : la FAQ dit que les données des candidats ne servent jamais à entraîner des modèles, mais cette page ne dit pas où sont hébergés les enregistrements de webcam et d'écran. Pour un employeur européen, c'est la première question.
La décision finale, en dernier. Le guide du candidat de HackerRank dit « Chakra ne prend pas de décisions d'embauche », et ça doit rester ainsi. New York exige déjà des audits de biais et une notification des candidats pour certains outils de recrutement automatisés, et l'AI Act européen classe les systèmes qui évaluent des candidats à l'emploi parmi les systèmes à haut risque dans son Annexe III.
Je ne recrute pas au volume pour lequel Chakra est conçu. Mais j'emprunte le format : un vrai dépôt, l'assistant autorisé, un plan d'abord, et vingt minutes à la fin sur ce que le candidat a rejeté de l'IA. L'artefact ne coûte plus rien. L'explication, si.
Sources
- TechCrunch, "HackerRank's AI interviewer offers a glimpse into what job interviews could become" (5 octobre 2026)
- HackerRank, "Chakra: Agentic AI Interviewer for Tech Hiring" (consulté le 7 octobre 2026)
- HackerRank Candidates Knowledge Base, "Evaluation in Chakra" (consulté le 7 octobre 2026)
- HackerRank Candidates Knowledge Base, "Interview with Chakra" (consulté le 7 octobre 2026)
- HackerRank Blog, "How HackerRank's Chakra Scores an Interview" (24 juillet 2026)
- HackerRank Blog, "How HackerRank Is Rebuilding Developer Hiring for the Agentic Era" (29 juillet 2026)
- HackerRank Knowledge Base, "July 2026 Release Notes" (consulté le 7 octobre 2026)
- HackerRank Knowledge Base, "Chakra Integrity Signals" (consulté le 7 octobre 2026)
- HackerRank Knowledge Base, "View Candidate Report in Chakra" (consulté le 7 octobre 2026)
- EU Artificial Intelligence Act, "Annex III: High-Risk AI Systems Referred to in Article 6(2)" (consulté le 7 octobre 2026)
