Cómo una CNN distingue un rostro real de una foto en pantalla

Analizamos la arquitectura de una red convolucional entrenada para detectar ataques de presentación en sistemas de control de acceso, capa por capa.

El ejemplo parte de un escenario concreto: una cámara monocromática de baja resolución frente a un terminal de acceso. Sobre ese caso se revisan los filtros de la primera capa, el efecto del pooling y el comportamiento de las capas fully connected ante una impresión fotográfica del usuario legítimo.

No se trata de una explicación genérica de redes neuronales. El recorrido sigue una sola pregunta de seguridad y muestra qué activa cada nivel de la red cuando recibe una imagen real y cuando recibe un sustituto.

Formatos de lectura para cada nivel

No todos los lectores llegan con la misma base. Por eso los artículos se organizan en tres formatos que comparten el mismo rigor técnico pero difieren en profundidad y punto de entrada.

Análisis de arquitectura

Desglose completo de una red convolucional, capa por capa, con el detalle de qué hace cada operación y por qué está donde está. Pensado para quien ya implementó un modelo y quiere entender sus decisiones internas.

Leer el análisis de CNN

Comparativas de enfoques

Vision Transformers frente a CNN clásicas: diferencias en el mecanismo de atención, coste computacional y casos donde cada uno rinde mejor. Útil para decidir qué arquitectura conviene según el problema de seguridad que se enfrenta.

Ver la comparativa de transformadores

Guías de interpretación

Métodos prácticos para inspeccionar qué aprende realmente una red: filtros, mapas de activación y Grad-CAM aplicados a ejemplos concretos. Orientado a depurar modelos y detectar sesgos antes de ponerlos en producción.

Explorar las guías de visualización

Cada formato termina con el código y los parámetros usados, para que puedas reproducir los resultados sin depender de capturas de pantalla.

Lecturas para seguir el hilo

Si el artículo anterior te dejó con preguntas sobre cómo se construye un sistema de visión, estos tres textos profundizan en las piezas que aparecen una y otra vez en la práctica: la arquitectura, el mecanismo de atención y la forma de mirar lo que la red realmente aprendió.

Arquitectura de una CNN: de los píxeles a las características

Desglose de capas convolucionales, pooling y fully connected, con ejemplos de filtros aprendidos en cada etapa.

Transformers en visión: cómo superaron a las CNN en precisión

Por qué la atención global cambió el paradigma y qué retos computacionales trajo consigo.

Visualizando capas intermedias: qué aprende realmente una red

Métodos prácticos como Grad-CAM para inspeccionar filtros y mapas de activación, y usar esa información para depurar modelos.

Aviso de cookies

Utilizamos cookies para mejorar tu experiencia y analizar el tráfico. Puedes aceptarlas, rechazarlas o gestionar tus preferencias.