Volver al blog
Carrera e IA

El nuevo entrevistador de IA de HackerRank deja que los candidatos usen IA y luego pregunta qué cambiaron en su código

7 de octubre de 2026 6 min de lectura

El lunes 5 de octubre, HackerRank hizo que Chakra estuviera disponible para todos sus clientes. Según TechCrunch, el entrevistador de IA pasó unos seis meses en beta y realizó más de 500.000 entrevistas, con Snowflake, Snorkel y Capgemini entre las empresas que lo probaron.

Chakra no lee preguntas de una lista. Abre un espacio de trabajo con un repositorio de código real y un asistente de IA, observa al candidato trabajar y luego le pregunta por qué hizo lo que hizo. El CEO de HackerRank, Vivek Ravisankar, resumió el razonamiento en una frase a TechCrunch: «La modalidad de evaluación anterior evaluaba el resultado. Ahora, por la IA, cualquiera puede producir un artefacto».

Estoy a ambos lados de esta mesa. Como desarrollador freelance, paso pruebas técnicas para ganar proyectos. Como CTO de CBlindspot, una LegalTech que construyo sobre Claude, decido quién se une. Así que leí más allá de la noticia del lanzamiento, hasta la documentación que HackerRank escribió para cada lado.

Cómo es la entrevista

El equipo de selección empieza con un plan de entrevista generado a partir de una descripción de puesto: secciones, temas, criterios para una buena respuesta. Todos los candidatos al puesto reciben el mismo plan. Chakra puede reformular y repreguntar, pero el listón no se mueve.

La parte práctica viene en dos formas: una pregunta de código resuelta sin IA, o una pregunta asistida por IA en lo que HackerRank llama un «Agentic Development Environment», donde se planifica, se construye y se revisa con un asistente. La demo de la página del producto muestra el segundo tipo: una aplicación ficticia llamada Shipway, una carpeta de tickets de errores, un reloj de 30 minutos y la instrucción de escribir un PLAN.md antes de tocar ningún código, que cubra cada problema, el enfoque, los criterios de aceptación y los riesgos.

Durante la construcción, Chakra se mantiene casi callado, y la guía del candidato dice que el silencio no se penaliza. La entrevista de verdad empieza después de Submit. El seguimiento pregunta cómo acotaste los requisitos, por qué tomaste las decisiones clave, qué revisaste, cuestionaste o cambiaste en la salida del asistente, cómo validaste el resultado y cómo cambiaría tu solución si cambiara una restricción importante.

Ravisankar le dijo a TechCrunch que esta única sesión sustituye tres etapas: una criba con un reclutador, una prueba para hacer en casa y una entrevista de seguimiento con un ingeniero.

Cómo puntúa

HackerRank describe tres agentes: uno convierte la descripción de puesto en el plan, otro dirige la entrevista en vivo y un Reporter lee después toda la transcripción y puntúa cada expectativa por separado. La escala es 3 para cumplida, 2 para parcialmente cumplida, 1 para no cumplida y 0 para «Not Assessed»: «Si no hay ningún momento relevante, la expectativa no se puntúa en absoluto». Luego las puntuaciones se normalizan de 0 a 5 para el reclutador. Una buena respuesta en un área no compensa una débil en otra.

Para la parte práctica, se califican tres cosas por separado. La solución, en cuanto a completitud, causas raíz, casos límite y regresiones (las ejecuciones de pruebas fallidas y los intentos anteriores no cuentan en tu contra). La discusión de seguimiento, según lo claramente que defiendes el trabajo. Y la fluidez con la IA: cómo planteas la tarea y sus restricciones, con qué deliberación guías al asistente, con qué cuidado revisas, pruebas y corriges su salida. Esa última puntuación lee tanto tus intercambios con el asistente como tus acciones en el editor, como ejecutar pruebas.

El informe de ejemplo de la página del producto da a un candidato un 4,1 en «Agentic Coding», y luego explica: «En conjunto fue vibe-coding pasivo: el resultado es plausible, pero el candidato no demostró que entendiera o pudiera defender lo que aceptó». El candidato «se apoyó en "i trusted the AI"». Esa frase es toda la tesis del producto.

La decisión que más respeto es «Not Assessed». Uso un pequeño modelo juez para decisiones de sí o no en mis propios sistemas, y una puntuación solo vale lo que valen las pruebas que hay detrás.

La trampa, al revés

Permitir la IA debería facilitar hacer trampa. HackerRank dice lo contrario: las alertas de actividad sospechosa fueron entre un 70 y un 80 % menores que en evaluaciones tradicionales comparables de HackerRank, según la geografía y la antigüedad. La explicación de Ravisankar: cuando se proporciona un asistente, hay menos motivos para colar otro.

No es un examen a libro abierto. El candidato comparte pantalla y cámara web, trabaja a pantalla completa en un solo monitor, y Chakra se pausa si sale de la pantalla completa, conecta una segunda pantalla o sale del encuadre de la cámara. El análisis de capturas de pantalla busca asistentes de IA externos; la página del producto nombra aplicaciones como Cluely, un dispositivo externo o tu «amigo». La regla pasó de «sin IA» a «nuestra IA, a la vista de todos». Eso se parece más a cómo trabajo cada día.

Lo que no puede ver

La guía del candidato dice que Chakra «no infiere habilidades o experiencia de las que no hables». Es justo, pero entonces la puntuación mide la explicación bajo reloj, en una conversación de voz. Un desarrollador que piensa bien pero narra mal lo paga, y posiblemente también quien no tiene el idioma como lengua materna, yo incluido. HackerRank dice que comprueba la consistencia de la puntuación según la redacción, el tono y la gramática. Aun así lo comprobaría con mis propios candidatos.

La consistencia tampoco es corrección. Una rúbrica aplicada igual a todos aplica igual también sus errores, y la rúbrica la escribe el empleador. TechCrunch señala que las herramientas de selección automatizadas pueden heredar sesgos de sus datos, modelos y criterios.

Treinta minutos en un repositorio ficticio no mostrarán cómo se comporta alguien después de tres semanas en un código desordenado, qué pregunta le hace a un cliente antes de escribir código, qué decide no construir o cómo discrepa de un compañero. En el relato de TechCrunch, el propio Ravisankar deja en manos humanas la cuestión de si realmente quieren trabajar con un candidato.

Las señales de integridad también son probabilidades. La versión de julio de HackerRank añadió detección de la mirada, que marca apartar la vista repetidamente seguido de escribir como una señal de gravedad media «para que los equipos de selección puedan revisar en lugar de marcar automáticamente». La gente aparta la mirada para pensar. La documentación de los informes de Chakra dice que se revisen las pruebas antes de sacar conclusiones.

Qué practicaría como candidato, a partir del lunes

Escribir el plan antes que el código, con criterios de aceptación que realmente se puedan probar. Cuando el asistente proponga algo, decidir en voz alta, o en el plan, qué conservas y qué rechazas, porque «¿qué cambiaste de su salida?» va a llegar. Ejecutar las pruebas donde se vean. Responder con tu rol, la decisión, el compromiso y el resultado medido; la guía dice que las respuestas más largas no puntúan más. Decir «no lo sé» cuando sea verdad. Prepararse para «¿y si esta restricción cambiara?». Y desenchufar el segundo monitor.

Qué mantendría humano como equipo de selección

La rúbrica, primero. La versión de julio permite marcar requisitos imprescindibles que pesan más en la puntuación, así que elegirlos es una decisión, no un ajuste.

La calibración, segundo. HackerRank dice que solo usa un modelo de puntuación cuando el acuerdo entre expertos humanos y la IA supera «cierto nivel», sin dar ese nivel en esa página. Compruébenlo ustedes mismos el lunes: que dos ingenieros puntúen a ciegas unas cuantas sesiones grabadas y luego comparen con Chakra.

Cada señal de integridad, revisada por una persona antes de que le cueste el empleo a alguien. Y la cuestión de los datos: las preguntas frecuentes dicen que los datos de los candidatos nunca se usan para entrenar modelos, pero esa página no dice dónde se alojan las grabaciones de cámara y pantalla. Para un empleador europeo, es la primera pregunta.

La decisión final, la última. La guía del candidato de HackerRank dice «Chakra no toma decisiones de contratación», y debería seguir así. Nueva York ya exige auditorías de sesgo y aviso a los candidatos para ciertas herramientas de selección automatizadas, y la Ley de IA de la UE clasifica los sistemas que evalúan a candidatos a un empleo como de alto riesgo en su Anexo III.

No contrato al volumen para el que está pensado Chakra. Pero tomo prestado el formato: un repositorio real, el asistente permitido, un plan primero y veinte minutos al final sobre lo que el candidato rechazó de la IA. El artefacto ahora es barato. La explicación no.

Fuentes

¿Un proyecto del mismo estilo?

Diseño y despliego productos como este. Hablemos.

Hablemos