Una nueva fuente de código abierto envenena los raspadores de IA con palabras falsas que no pueden detectar

ShieldFont cambia palabras de contenido real por sustitutos plausibles en HTML sin procesar, de modo que la página se ve normal para los humanos pero proporciona texto distorsionado a los bots que la recopilan para el entrenamiento de IA.

AI2Day NewsdeskUpdated Editor: Lee Brown4 min read
Full-frame photoreal editorial image of a modern developer's desk at dusk, two monitors glowing with abstract lines of code, one screen subtly tinted a cool blu
Share

Puntos clave

  • ShieldFont, un proyecto de código abierto del estudio ámsterdam Seneda & Abrucio, reemplaza aproximadamente una cuarta parte de las palabras de contenido en HTML sin procesar con sustitutos plausibles que se ven correctos para los lectores humanos.
  • La fuente utiliza un sistema de sustitución de glifos, una característica estándar integrada en las fuentes OpenType que intercambia caracteres o palabras automáticamente, para mostrar texto real en pantalla mientras oculta texto alterado en el código subyacente.
  • El proyecto incluye tres diccionarios de intercambio de palabras separados, y los usuarios pueden crear los suyos propios para dificultar la ingeniería inversa.
  • ShieldFont tiene compensaciones reales: puede perjudicar las clasificaciones de los motores de búsqueda, romper copiar-pegar y causar problemas para los lectores de pantalla utilizados por personas con discapacidad visual.
  • El proyecto está disponible hoy como una demostración gratuita, un componente React e integración CSS/CDN, aunque los creadores lo describen como versión 0/alfa.

Si publicas escritos originales en línea, probablemente te hayas preguntado si las empresas de IA están recopilando silenciosamente tus palabras para datos de entrenamiento. Un archivo robots.txt puede ser ignorado. El bloqueo del lado del servidor requiere habilidades técnicas reales. Ahora un pequeño estudio de diseño ámsterdam cree que tiene una tercera opción, y funciona a nivel de fuente. Cubrimos el tema del bloqueo de raspadores cuando Patreon pasó de solicitudes educadas a la aplicación activa el 17 de julio; ShieldFont adopta un ángulo completamente diferente.

El proyecto se llama ShieldFont. Reportado por primera vez por The Register AI, fue construido por Isaque Seneda y Gabriel Abrucio de Seneda & Abrucio, en colaboración con la empresa de tipografía de Copenhague Playtype.

¿Cómo funciona realmente?

ShieldFont explota una característica estándar dentro de las fuentes OpenType llamada GSUB, abreviatura de sustitución de glifos, la regla integrada que le dice a tu computadora que intercambie automáticamente ciertas combinaciones de caracteres por versiones más limpias. El ejemplo clásico es que las letras "fi" se fusionen en un solo carácter limpio para que la parte superior de la F no choque con el punto de la i.

ShieldFont extiende esa misma lógica de intercambio a palabras completas. Escribe "daughter" en una página con una tipografía ShieldFont y tus visitantes ven "daughter". Sin embargo, el HTML sin procesar que lee un raspador podría decir "journalist".

El intercambio no es aleatorio. El equipo construyó alrededor de 250 grupos de palabras, cada uno agrupado por parte de la oración y categoría de significado. Un sustantivo abstracto plural sobre comunicación siempre se reemplaza solo por otro sustantivo abstracto plural sobre comunicación. El resultado es un texto que suena extraño pero no obviamente roto, lo que importa para la estrategia: el objetivo no es el rechazo sino la ingestión de datos incorrectos.

"Queremos un mecanismo con consecuencias reales", explicaron Seneda y Abrucio. "Raspa sin pedir permiso, y no puedes saber si lo que tomaste era real".

Característica Detalle
Palabras reemplazadas por página Aproximadamente una cuarta parte de las palabras de contenido
Diccionarios GSUB incluidos 3 (los personalizados son posibles)
Tamaño del archivo de fuente de escritorio Alrededor de 5 MB
Tamaño de fuente web comprimida Alrededor de 800 KB
Etapa de lanzamiento actual v0/alfa

¿Cuáles son los costos reales de usar esto?

ShieldFont no es una solución limpia. El mismo HTML sin procesar que engaña a un raspador es lo que Google lee para clasificar tu página, así que usarlo podría empujar tu sitio hacia abajo en las clasificaciones. Copiar-pegar también extrae del código sin procesar, lo que significa que un lector que copia una oración obtiene la versión desordenada. Los lectores de pantalla, en los que las personas con discapacidad visual confían para escuchar páginas web leídas en voz alta, también tienen dificultades con ello, aunque el equipo ha integrado un retroceso más lento para ayudar.

Los bots dirigidos que descargan los archivos ShieldFont directamente y recorren los tres diccionarios pueden decodificar los intercambios. Una captura de pantalla pasada a través de OCR, software que lee texto de imágenes, evita completamente el truco.

Los creadores son transparentes sobre los límites. "Su propósito no es detener a un actor determinado", escribieron, "sino ralentizar el raspado masivo no autorizado agregando costo e incertidumbre".

Veredicto honesto: ShieldFont vale la pena experimentar cuidadosamente si publicas contenido original y deseas que el raspado en masa cueste más a los bots. Pruébalo primero en una sección de tu sitio y observa qué sucede con el tráfico de búsqueda. El codificador de demostración gratuito en el sitio web de ShieldFont te permite pegar cualquier texto y ver exactamente cómo se vería el HTML sin procesar antes de que te comprometas.

© 2026 AI2Day