El 14 de julio de 2026, la comunidad de ciberseguridad recibió una dura lección sobre la confianza ciega en las herramientas de IA generativa. Investigaciones independientes revelaron que la CLI de codificación Grok Build (versión 0.2.93) de xAI estaba cargando repositorios de Git completos, incluyendo todo el historial de commits, a un bucket de Google Cloud Storage propiedad de la empresa. La telemetría mostró una brecha de 27,800 veces entre lo que el modelo necesitaba leer (192 KB) y lo que realmente exfiltró (5.10 GiB).

1. La trampa del "Opt-Out" (Optar por no participar)

El hallazgo más alarmante no fue solo la exfiltración, sino el engaño en la interfaz de usuario. Los desarrolladores que desactivaron la opción "Mejorar el modelo" asumieron que su código estaba seguro. Sin embargo, ese interruptor solo gobernaba el entrenamiento del modelo, no la retención o transmisión de datos. La telemetría del servidor confirmó que la carga de rastros (trace_upload_enabled) permanecía activa independientemente de la preferencia de privacidad del usuario. En la era de la IA, un opt-out de entrenamiento no es una garantía de confidencialidad.

2. El historial de Git como responsabilidad silenciosa

Las herramientas de IA que solicitan acceso al directorio raíz de un proyecto no solo leen el árbol de trabajo actual; leen el archivo .git. Esto significa que cualquier secreto, credencial de API o dato de clientes que haya sido commiteado y luego eliminado en el pasado sigue presente en el historial. La exfiltración del historial de commits convierte los errores pasados de gestión de secretos en fugas de datos activas y a gran escala.

3. La prueba del canario no leído: Los investigadores plantaron un archivo llamado never_read_canary.txt con instrucciones explícitas para que la IA no lo abriera. El modelo obedeció y no lo leyó para su contexto, pero el agente de fondo lo empaquetó y lo envió al almacenamiento remoto de todos modos. Esto demuestra que la exfiltración es un proceso sistémico y automatizado, no un subproducto de las solicitudes del modelo.

4. Estrategias de mitigación: Zero Trust para agentes de IA

Para hacer frente a esta nueva realidad, las organizaciones deben implementar estrategias de defensa proactiva contra sus propias herramientas de productividad:

5. Especulación: El modelo de negocio de la recolección oculta

Aunque xAI desactivó la función del lado del servidor tras la exposición pública, el código de carga permaneció en el binario del cliente. Esto sugiere una estrategia de "recolección por defecto" donde la fricción de la exfiltración solo se detiene cuando es descubierta. Es muy probable que veamos a otros proveedores de LLM adoptar tácticas similares, disfrazando la recolección de datos de entrenamiento como "telemetría de sesión" o "archivos de estado" para eludir las regulaciones de privacidad y los acuerdos de confidencialidad (NDA) empresariales.

Si una herramienta de IA puede exfiltrar 5 GB de propiedad intelectual mientras el usuario cree que ha optado por la privacidad, la pregunta ya no es si su código está siendo leído por una IA, sino en qué servidor de almacenamiento en la nube está siendo archivado.