
Casi todos conocemos la escena: iniciamos sesión en un sitio, pulsamos «No soy un robot» y aparece una cuadrícula de nueve imágenes que nos pide seleccionar todos los semáforos, motocicletas o autobuses. Terminamos una ronda y llega otra. A veces estamos seguros de haber acertado, pero el sistema obliga a repetir. En determinadas redes, los desafíos pueden sucederse sin parar.
Los CAPTCHA nacieron para complicarles la vida a las máquinas. Hoy, las máquinas quizá ya sean mejores que las personas resolviendo muchos de estos ejercicios.
En 2024, un grupo de investigadores evaluó Google reCAPTCHA v2 sin utilizar GPT. Entrenó un modelo visual YOLOv8 para reconocer los objetos objetivo y lo combinó con automatización del navegador. El artículo informó que superó los 100 intentos de prueba.
En 2025, la investigación dejó de centrarse en un único formato. Nuevos benchmarks empezaron a evaluar modelos de visión y lenguaje frente a texto distorsionado, selección de imágenes, deslizadores, rotaciones y otros tipos de CAPTCHA. Algunos ya se parecen a tareas normales de visión artificial. Otros todavía exigen localización precisa, razonamiento espacial e interacción continua, y ahí la tasa de éxito cae con claridad.
En 2026, la pregunta ha vuelto a cambiar. Ya no es solo «¿puede la IA entender el CAPTCHA?», sino «¿puede abrir la página, comprender el desafío, hacer clic o arrastrar, detectar errores, corregirse y continuar con su tarea original?».
La respuesta se acerca cada vez más a un sí.
Por eso merece la pena volver a hablar de CAPTCHA. No ha desaparecido como control de seguridad, pero sus supuestos originales están cambiando. En 2026 necesitamos una imagen más precisa de lo que realmente puede hacer la IA al resolver CAPTCHA.
La apuesta original del CAPTCHA: las personas pueden, las máquinas no
La idea central de CAPTCHA es sencilla: encontrar una tarea fácil para las personas y difícil para las máquinas, y usarla para distinguirlas.
El formato clásico era el texto distorsionado. Las letras se giraban o pegaban y el fondo incorporaba ruido y líneas. Una persona normalmente podía entrecerrar los ojos y leerlas; para el OCR de la época era una prueba difícil. Cuando mejoró el OCR, los proveedores cambiaron de ejercicio. Google reCAPTCHA recurrió cada vez más a imágenes, pidiendo identificar coches, semáforos o motocicletas.
El juego seguía siendo el mismo: encontrar una capacidad perceptiva en la que los humanos fueran buenos y las máquinas todavía no.
El problema es que esas capacidades están entre las que más han mejorado en IA durante los últimos veinte años: OCR, clasificación de imágenes, detección de objetos, reconocimiento de voz y, ahora, modelos de visión y lenguaje. CAPTCHA busca nuevos puntos ciegos de las máquinas, y las máquinas vuelven a alcanzarlo.
Por eso ya no basta con preguntar «¿qué precisión tiene la IA reconociendo CAPTCHA?». Un análisis útil debe separar al menos tres capas:
- Recognition: ¿puede la IA entender el desafío y determinar la respuesta correcta?
- Interaction: una vez que conoce la respuesta, ¿puede hacer clic, arrastrar y completar varias rondas en el navegador?
- Acceptance: aunque resuelva el ejercicio, ¿aceptará la solicitud el sistema de riesgo del servidor?
Son problemas cada vez más distintos.

Los CAPTCHA de texto se han convertido en un problema de OCR
Los CAPTCHA de texto tradicionales ya no pueden sostener por sí solos una frontera crítica de seguridad. La razón es simple: en esencia son una tarea de OCR.
Si un sitio todavía utiliza fuentes, distribuciones de ruido y longitudes fijas, un atacante que consiga suficientes muestras no necesita investigación de vanguardia para entrenar un modelo especializado. Muchas veces ni siquiera necesita un modelo grande.
Al hablar de IA para resolver CAPTCHA, es fácil pensar en sistemas generales como GPT, Gemini o Qwen. Sin embargo, para un formato fijo, un modelo especializado puede ser más barato y rápido. Un OCR o modelo visual ligero, entrenado para ese CAPTCHA, puede ejecutarse localmente con un coste marginal muy bajo.
Las cuadrículas de imágenes se parecen cada vez más a la detección de objetos
Los CAPTCHA de imágenes elevaron considerablemente la barrera. «Selecciona todas las imágenes que contienen un autobús» no era fácil para la visión artificial inicial. Hoy la definición resulta familiar: detección de objetos y clasificación de imágenes.
El artículo de 2024 Breaking reCAPTCHAv2 utilizó YOLOv8 para identificar las categorías objetivo en los desafíos visuales de reCAPTCHA v2 y automatizó los clics. Informó que superó los 100 intentos de prueba.
Ese «100%» no significa que reCAPTCHA, como sistema completo, sea inútil. Significa que, en las condiciones concretas del experimento, el ejercicio visual no distinguió de forma fiable entre máquinas y personas. reCAPTCHA sigue utilizando cookies, contexto del navegador, historial, puntuación de riesgo y otros mecanismos que no desaparecen cuando funciona el reconocimiento de imágenes.
Pero el supuesto más visible —«una máquina no debería reconocer un semáforo»— está dejando de ser válido.
Los atacantes ya no siempre necesitan entrenar un modelo específico
Usar YOLO contra reCAPTCHA sigue una receta tradicional: recopilar datos, etiquetarlos y entrenar un solver para un formato concreto. El método es barato, rápido y estable, pero depende mucho del tipo de desafío.
Si la prueba cambia de «encuentra los coches» a «selecciona dos objetos que sirvan para lo mismo», un modelo entrenado solo con coches, autobuses y semáforos puede fallar.
Los modelos de visión y lenguaje cambian esa limitación. Las familias Qwen, Gemini y GPT pueden comprender conjuntamente imágenes, instrucciones escritas y relaciones espaciales, en lugar de reconocer únicamente un conjunto fijo de categorías.
El estudio de 2025 MCA-Bench reunió varios formatos CAPTCHA en un marco de evaluación común para modelos de visión y lenguaje. Encontró que modelos Qwen2.5-VL entrenados podían alcanzar un éxito alto en algunas tareas de texto distorsionado y selección de imágenes 3×3, mientras que el rendimiento caía claramente en deslizadores, rotaciones y razonamiento espacial complejo.
La diferencia muestra hacia dónde se desplaza la dificultad. Antes importaba entender la imagen; ahora importa convertir esa comprensión en una interacción precisa.

Por qué los CAPTCHA deslizantes eran más difíciles
Un CAPTCHA deslizante es un buen ejemplo. Una imagen contiene una pieza ausente y el usuario debe arrastrar un control hasta alinear la pieza con el hueco.
Añade una capa frente a la cuadrícula. Esta solo pregunta «¿dónde está el semáforo?». El deslizador también pregunta «¿dónde está el hueco, cuánto debo arrastrar y parece natural la trayectoria?». Combina percepción e interacción conductual.
Tampoco creó una frontera permanente. El trabajo de 2024 The robustness of behavior-verification-based slider CAPTCHAs evaluó cinco sistemas deslizantes ampliamente desplegados e informó tasas de ataque de entre el 87,5% y el 100%.
Una vez más, un atacante decidido puede adaptar un algoritmo a un desafío concreto. Sustituir imágenes por un deslizador no es una solución permanente. Detectar el hueco ya es una tarea madura de visión artificial. Las señales más difíciles se sitúan cada vez más alrededor del ejercicio: trayectoria del puntero, tiempos, contexto de la página, historial de sesión y reputación de la IP.
En 2026, los agentes GUI empiezan a resolver CAPTCHA por sí mismos
Lo que diferencia la ola actual es que los agentes GUI empiezan a tratar los CAPTCHA como una interacción web corriente.
El artículo de 2026 CAPTCHA Solving for Native GUI Agents presentó ReCAP, un agente GUI nativo entrenado específicamente para mejorar su capacidad con CAPTCHA. En lugar de enviar una captura a un modelo y usar otro script para interpretar la respuesta y hacer clic, el modelo observa directamente la pantalla y genera acciones de interfaz. Puede encontrar objetivos, pulsar, observar el siguiente fotograma, detectar un error y corregirse.
Los investigadores entrenaron modelos de la familia Qwen3-VL. El modelo de 32B logró cerca del 81% de éxito global en el benchmark dinámico del artículo, con unas 1,54 llamadas al modelo de media y menos de tres segundos de ejecución integral. Son resultados de un benchmark concreto, no una tasa universal para sitios reales.
La dirección, aun así, está clara: resolver CAPTCHA está pasando de ser una habilidad ofensiva especializada a una capacidad secundaria de los agentes generales de Computer Use.

Antes, superar un CAPTCHA exigía construir un solver específico. Un agente del futuro podrá estar reservando un billete, comprando o completando un formulario, encontrarse con un CAPTCHA a mitad del proceso, resolverlo y continuar con la tarea original.
Resolver el ejercicio no equivale a superar el sistema
Los resultados anteriores pueden invitar a afirmar que «CAPTCHA ha muerto», pero la realidad es más compleja.
Supongamos que una IA identifica todos los semáforos con precisión perfecta y pulsa correctamente las nueve imágenes. Google todavía puede rechazarla. Los sistemas CAPTCHA modernos hacen mucho más que corregir la respuesta visible.
El servidor ve mucho más que una captura. Puede comprobar la IP y si pertenece al ASN de un centro de datos, si el dispositivo había aparecido antes, el historial de cookies, la coherencia del navegador, la frecuencia de solicitudes, los desafíos repetidos en una sesión, la antigüedad de la cuenta y las desviaciones frente al comportamiento normal.
Por eso hay que separar Recognition, Interaction y Acceptance. Un modelo con un 98% de acierto en un benchmark offline no obtiene automáticamente un 98% de éxito integral. El reconocimiento es solo una capa.

La economía del ataque también ha cambiado
El principal coste de atacar un CAPTCHA procedía antes de la incapacidad de la máquina para resolverlo. Ese coste cae con rapidez.
Los modelos especializados de OCR o YOLO pueden ejecutarse por completo en hardware local. También hay cada vez más modelos abiertos de visión y lenguaje. Para tareas fijas, la inferencia pura puede tener un coste marginal muy bajo.
El mercado público de resolución muestra lo mismo. En agosto de 2026, un proveedor anunciaba CAPTCHA de imagen y reCAPTCHA v2 por aproximadamente 0,50 a 2,99 dólares cada 1.000 resoluciones. Los precios cambian y pueden combinar capacidad humana y automática, pero demuestran hasta qué punto se ha convertido en un producto básico «obtener la respuesta».
A gran escala, los elementos caros ya no suelen ser el reconocimiento, sino las IP proxy, una reputación limpia, navegadores realistas, identidad de dispositivo, inventario de cuentas, mantenimiento de sesiones y reintentos.
El objetivo defensivo ha cambiado en consecuencia.
Antes se pretendía que la máquina no pudiera resolver el ejercicio.
Ahora el objetivo realista es que automatizarlo a gran escala no resulte rentable.
Google ya no pone el ejercicio en el centro
La evolución de Google muestra hasta dónde ha llegado reCAPTCHA.
reCAPTCHA forma ahora parte de un sistema Fraud Defense más amplio. Ya no pregunta solo si la respuesta es correcta, sino que evalúa el riesgo de toda la solicitud. El servidor puede recibir una puntuación de 0,0 a 1,0: 1,0 indica tráfico muy probablemente legítimo y 0,0 tráfico muy probablemente ilegítimo. La aplicación decide después cómo responder. La API de evaluación de Google también incluye verifiedBots, un campo para bots cuya identidad ha sido verificada.
En un inicio de sesión, una solicitud de bajo riesgo puede continuar; un riesgo medio puede activar la verificación por correo, uno más alto puede exigir MFA y el máximo riesgo puede producir un rechazo.
El modelo antiguo era: resuelve el CAPTCHA y pasa. El nuevo es: recopila señales, calcula el riesgo y deja que la aplicación decida si permite, refuerza la verificación o rechaza.
Cloudflare va más allá: lo ideal es que el usuario no resuelva nada
Cloudflare Turnstile es todavía más representativo. Parece una alternativa a CAPTCHA, pero su objetivo pasó de obligar al usuario a completar un desafío a dejar que los usuarios legítimos avancen con la mínima fricción.
La documentación de Turnstile explica que el navegador ejecuta pequeños desafíos no interactivos y reúne señales del cliente y del entorno. Incluyen proof-of-work, proof-of-space, sondeo de Web API, peculiaridades del navegador y señales de comportamiento. El modo Managed elige la acción según las señales y el riesgo; los visitantes de bajo riesgo pasan sin interactuar y la casilla solo aparece cuando hace falta otra comprobación.
Aunque el desafío parezca resuelto en el navegador, Cloudflare exige validar el token en el servidor. Su documentación afirma explícitamente que resolver un desafío no confirma automáticamente que el visitante sea humano.
Esa frase resume el estado de CAPTCHA en 2026.
Saber resolver el ejercicio ya no equivale a superar la decisión de seguridad.
hCaptcha no ha abandonado los desafíos activos
hCaptcha sigue una ruta algo distinta a Google y Cloudflare. Mantiene más desafíos visuales activos, pero también ofrece funcionamiento invisible y puntuaciones de riesgo. El modo invisible se ejecuta en segundo plano y solo muestra un desafío cuando se cumplen ciertos criterios; el funcionamiento totalmente pasivo depende de la puntuación empresarial.
La lógica es intuitiva: aunque los modelos actuales rompan un formato, el proveedor puede cambiar la tarea, añadir complejidad de interacción y rotar desafíos para abrir temporalmente una nueva distancia entre personas y máquinas.
La investigación persigue la misma idea con ilusiones visuales, ilusiones de audio y razonamiento espacial más complejo.
El artículo de 2026 Robust CAPTCHA Using Audio Illusions in the Era of Large Language Models presentó IllusionAudio. Informó de una tasa de bypass del 0% frente a los ataques con modelos de audio y ASR evaluados, además de un 100% de aprobación humana en su estudio de usuarios.
Es un resultado experimental impresionante, pero plantea una pregunta conocida: cuando el formato se hace público, los atacantes pueden recopilar datos específicos, generar muestras y ajustar modelos.
Los más de veinte años de CAPTCHA repiten el mismo ciclo: encontrar una tarea fácil para humanos y difícil para máquinas; desplegarla; entrenar máquinas; romperla; añadir complejidad; y buscar otra tarea.
La IA generativa no ha terminado con el ciclo. Lo ha acelerado.
El problema más difícil quizá sean los agentes legítimos, no los bots maliciosos
El modelo original de CAPTCHA no contempló otra posibilidad: el tráfico de máquinas del futuro no siempre será dañino.
Históricamente, los bots eran crawlers, registros de spam, credential stuffing, reventa de entradas, abuso de inventario o clics publicitarios automáticos. Era tentador equiparar Human con Good y Bot con Bad.
La era de los agentes rompe ese supuesto.
Un agente de IA que reserva mi hotel es un bot, pero ¿debería bloquearse? No necesariamente. Un agente puede presentar un gasto, ayudar a una persona ciega a navegar, comparar productos y hacer un pedido autorizado u operar un SaaS empresarial en nombre de un empleado. Son programas automáticos, pero pueden contar con autorización real del usuario.
La API de análisis de riesgo de Google ya incluye el concepto de identidad de bot verificada, lo que apunta hacia ese futuro. Los sitios quizá deban dejar de preguntar solo «¿eres un robot?» y empezar a preguntar: ¿quién es este agente?, ¿quién lo autorizó?, ¿qué intenta hacer?, ¿qué alcance tiene permitido?, ¿qué reputación posee?, ¿envía tres solicitudes por minuto o treinta mil?

Preguntas frecuentes
¿Puede la IA resolver CAPTCHA en 2026?
Puede resolver muchos, pero reconocer la respuesta correcta y ser aceptada por el servidor son resultados distintos. Los CAPTCHA de texto e imágenes comunes son muy resolubles. Los deslizadores, las rotaciones y los desafíos dinámicos de varios pasos siguen siendo más difíciles, mientras que los sistemas modernos también evalúan IP, dispositivo, navegador, cuenta y conducta.
¿Sigue siendo segura la prueba de imágenes de reCAPTCHA v2?
La imagen por sí sola ya no debe considerarse una frontera estable entre humanos y máquinas. Un estudio de 2024 superó 100 intentos bajo condiciones concretas, pero la seguridad global de reCAPTCHA también depende de puntuación de riesgo, cookies, historial del navegador y otras señales.
¿Por qué cambian los agentes GUI el modelo de amenaza?
Porque conectan reconocimiento, localización, clic, arrastre, feedback y corrección de errores en un proceso integral. Resolver un CAPTCHA puede convertirse en un paso dentro de la tarea de un agente web general, no en una capacidad exclusiva de solvers especializados.
¿Cómo deben responder los sitios a la IA que resuelve CAPTCHA?
No conviene usar un ejercicio visual como única frontera. Hay que combinar puntuación de riesgo, límites de frecuencia, señales de dispositivo y sesión, reputación de cuenta, MFA y validación del token en el servidor. Los agentes autorizados también necesitarán identidad verificable y permisos limitados.
Conclusión
Los últimos tres años muestran una progresión clara.
Primero cayeron los CAPTCHA de texto. Los de imágenes se convirtieron gradualmente en detección de objetos. Los modelos de visión y lenguaje empezaron a resolver formatos que antes necesitaban modelos especializados distintos. Después, los agentes GUI conectaron reconocimiento y acción.
La dificultad restante se concentra cada vez más en tareas dinámicas de varios pasos, control preciso y decisiones de riesgo dentro de entornos reales de servidor.
Por eso, los productos CAPTCHA más avanzados de 2026 se parecen cada vez menos a un CAPTCHA. Google calcula puntuaciones de riesgo. Cloudflare observa el navegador y el entorno del cliente. hCaptcha combina desafíos activos y señales pasivas.
El objetivo ya no es inventar un ejercicio que la IA jamás pueda resolver; esa promesa resulta cada vez más difícil de sostener. El objetivo práctico es que el acceso legítimo casi no tenga fricción y que el coste del abuso automatizado a gran escala aumente hasta dejar de ser rentable.
Referencias
- Breaking reCAPTCHAv2
- MCA-Bench: A Multimodal Benchmark for Evaluating CAPTCHA Robustness Against VLM-based Attacks
- The robustness of behavior-verification-based slider CAPTCHAs
- CAPTCHA Solving for Native GUI Agents
- Robust CAPTCHA Using Audio Illusions in the Era of Large Language Models
- Referencia de análisis de riesgo de Google Cloud reCAPTCHA
- Documentación de Cloudflare Turnstile
- Documentación de hCaptcha Invisible