Por Redacción Pangea IA · 9 de octubre de 2026
Una coalición de 121 miembros del Congreso de Estados Unidos ha pedido a Google y Spirit Airlines garantías verificables antes de que avance la venta de un enorme archivo interno de la aerolínea para entrenar sistemas de inteligencia artificial. El acuerdo, valorado en 10 millones de dólares, incluye alrededor de 100 millones de correos, 500 millones de mensajes de Microsoft Teams y otros registros corporativos. La disputa no gira solo en torno a si se eliminan nombres y números de identificación: plantea si los años de comunicaciones que una plantilla produjo para trabajar pueden convertirse, después, en materia prima para una IA.
Qué ha ocurrido ahora
El 8 de octubre, el congresista Steven Horsford y la senadora Elizabeth Warren hicieron pública una carta dirigida a Dave Davis, consejero delegado de Spirit, y Sundar Pichai, consejero delegado de Google. La iniciativa reúne a 121 senadores y representantes, contando a sus dos promotores, según la información difundida por el Congreso y el sindicato Association of Flight Attendants-CWA (AFA-CWA).
Los legisladores no anuncian una prohibición ni una resolución judicial. Reclaman que la operación incorpore salvaguardas vinculantes para las personas que trabajaron en Spirit y que se excluya su información hasta donde sea posible. La novedad relevante es, por tanto, política y de supervisión: el volumen y el destino de los datos han provocado una intervención bipartidista antes de la vista judicial prevista para el 14 de octubre.
La venta todavía necesita autorización judicial. Spirit dejó de operar en mayo y sus activos se están liquidando. Google ganó en agosto la puja por el archivo digital de la aerolínea con una oferta de 10 millones de dólares. Reuters señala que otra empresa de IA, Mercor, había ofrecido 7,5 millones por datos de empleados.
Qué datos incluye el acuerdo
El inventario citado por los congresistas y por AFA-CWA combina información operativa con comunicaciones laborales y registros de personal. No es una colección homogénea ni todos sus elementos tienen el mismo riesgo.
| Tipo de dato | Volumen o ejemplo | Riesgo principal |
|---|---|---|
| Correo corporativo | Unos 100 millones de mensajes | Contexto personal, decisiones internas y terceros mencionados |
| Mensajería de trabajo | Unos 500 millones de mensajes de Teams | Conversaciones informales difíciles de anonimizar por contexto |
| Registros laborales | Fichajes, nóminas, impuestos y contratos | Datos económicos y potencialmente sensibles |
| Información operativa | Documentos, calendarios, hojas de cálculo y procesos | Secretos empresariales, seguridad y propiedad intelectual |
La escala explica el valor para un desarrollador de IA. A diferencia de un corpus formado solo por páginas públicas, este archivo refleja cómo se coordina una organización real: preguntas, decisiones, incidencias, turnos, procedimientos, desacuerdos y resultados. Puede servir para enseñar a modelos y agentes a interpretar flujos de trabajo empresariales. Precisamente por eso también resulta difícil separar la utilidad técnica de la huella humana que contiene.
La posición de Google y el punto ciego de la anonimización
Google sostiene que no busca comprar información personal. La compañía dijo a Reuters que los datos personales se excluirán o serán desidentificados por un tercero independiente antes de la entrega. Un informe del ombudsman de privacidad designado por el tribunal respaldó la operación tras cambios que apartan las bases de datos de pasajeros y prevén esa desidentificación.
Ese informe se centró en los 97 millones de consumidores que habían facilitado datos a Spirit para viajar. Business Insider explica que la evaluación no resolvió de la misma manera el riesgo para los empleados. Ahí está la grieta que subrayan el sindicato y los congresistas: las garantías diseñadas para pasajeros no responden necesariamente a todo lo que contienen los expedientes y las conversaciones de trabajo.
Quitar nombres, direcciones o identificadores directos reduce riesgos, pero no convierte automáticamente un archivo en anónimo. Una combinación de puesto, fechas, rutas, turnos, responsables, incidentes y fragmentos de conversación puede volver identificable a una persona o a un grupo pequeño. Además, hay información confidencial que conserva su sensibilidad aunque ya no pueda atribuirse con facilidad a un individuo: decisiones de seguridad, evaluaciones internas, negociaciones o problemas operativos.
Este límite no es teórico. El Electronic Privacy Information Center presentó un escrito de apoyo a la objeción sindical y advirtió del riesgo de inferencia incluso después de desidentificar. La cuestión que tendrá que valorar el tribunal no es únicamente si desaparecen los campos obvios, sino si el conjunto permite reconstruir personas, relaciones o hechos confidenciales.
Por qué el caso importa a empresas y trabajadores
Los correos y chats corporativos suelen pertenecer a la infraestructura de la empresa, pero eso no elimina las obligaciones sobre su uso. El caso Spirit muestra que un repositorio creado para operar una compañía puede adquirir una segunda finalidad mucho después: entrenar modelos de IA. Esa reutilización cambia tanto la escala del tratamiento como sus posibles consecuencias.
- La política de conservación ya es una decisión de IA. Guardar indefinidamente conversaciones “por si acaso” amplía el material que puede reutilizarse, venderse o quedar expuesto.
- Los contratos de compraventa necesitan cláusulas de datos. En una adquisición, insolvencia o cierre, el archivo digital no debería tratarse como mobiliario sin examinar finalidades, bases jurídicas y derechos.
- Anonimizar exige pruebas, no una promesa genérica. Hay que documentar qué se elimina, qué correlaciones se conservan y cómo se mide el riesgo de reidentificación.
- Los datos de terceros también cuentan. Un correo laboral puede contener información de clientes, proveedores, candidatos o familiares que nunca participaron en la operación.
- La gobernanza debe empezar antes de recopilar. Cuanto más indiscriminado sea el archivo, más difícil será separar después lo útil de lo incompatible o sensible.
Para una pyme española, la lección práctica no es copiar el caso estadounidense, sino revisar su propio ciclo de vida de datos. Nuestra guía para crear una política de uso de IA en la empresa propone inventariar herramientas, definir responsables y limitar qué información puede entrar en sistemas externos. Esos controles también deberían cubrir fusiones, cambios de proveedor y cierre de servicios.
Qué cambia en España y la Unión Europea
El resultado del proceso de Spirit se decidirá bajo el marco estadounidense y no determina por sí solo lo que sería válido en la UE. Aquí, una empresa que quisiera reutilizar comunicaciones laborales para entrenar IA tendría que analizar el RGPD, la normativa laboral, la información facilitada a las personas afectadas y la compatibilidad de la nueva finalidad, entre otros elementos. No basta con afirmar que los sistemas son internos o que el archivo pertenece a la organización.
La Agencia Española de Protección de Datos recuerda en su guía sobre relaciones laborales que un dato personal es cualquier información relativa a una persona identificada o identificable. Sus materiales sobre protección de datos desde el diseño insisten además en minimizar cantidad, alcance, conservación y accesibilidad. El 7 de octubre, la AEPD publicó también una guía específica sobre sistemas algorítmicos en el ámbito laboral, una señal de que la supervisión del trabajo automatizado ya no es una cuestión periférica.
Eso no significa que todo entrenamiento con datos empresariales sea ilícito. Significa que la organización debe poder justificar y demostrar sus decisiones: finalidad concreta, base jurídica, necesidad, proporcionalidad, controles de acceso, plazo de borrado, información a las personas y evaluación de riesgos cuando proceda. Si interviene un proveedor, también debe quedar claro qué papel asume, si utiliza los datos para fines propios y qué ocurre al terminar el contrato.
Los fallos de diseño se vuelven visibles cuando un sistema accede a más información de la prevista. El caso en el que agentes de OpenAI expusieron imágenes de usuarios durante pruebas ilustra por qué permisos mínimos, entornos aislados y trazabilidad no son formalidades. La protección tiene que existir antes de conectar el repositorio al modelo.
Una lista de control antes de reutilizar datos corporativos
- Delimitar el propósito: describir qué capacidad se entrenará y por qué no basta un conjunto menos intrusivo.
- Clasificar el archivo: separar datos personales, categorías sensibles, secretos empresariales, propiedad intelectual y material de terceros.
- Reducir antes de transferir: excluir fuentes y periodos innecesarios; la minimización es más fiable que limpiar después todo el lago de datos.
- Probar la desidentificación: evaluar ataques de reidentificación y documentar los umbrales aceptados.
- Limitar el aprendizaje y la retención: definir si el proveedor puede incorporar la información a modelos generales y cuándo debe borrarla.
- Registrar accesos y resultados: conservar trazabilidad de quién consulta, copia o transforma los datos.
- Preparar derechos e incidentes: establecer cómo responder a solicitudes, errores, filtraciones o usos incompatibles.
- Revisar el escenario de salida: prever insolvencia, adquisición, cambio de proveedor y eliminación segura.
Para organizaciones que trabajan con datos estratégicos, este análisis debería integrarse con las garantías del proveedor. En Pangea IA ya examinamos por qué NVIDIA y Palantir reclamaban más controles sobre los datos empresariales. La diferencia ahora es que Spirit no está desplegando una herramienta en funcionamiento: está liquidando un archivo histórico como activo.
Qué queda por resolver
La carta del Congreso no detiene automáticamente la venta. La vista del 14 de octubre será el siguiente hito y el tribunal puede aprobar el acuerdo, exigir condiciones adicionales o aplazarlo. Tampoco se conoce públicamente con suficiente detalle qué fracción del archivo llegará finalmente a Google tras la exclusión y desidentificación, ni qué pruebas se aplicarán para demostrar que el riesgo residual es aceptable.
Conviene distinguir tres planos. Es un hecho que Google ganó la subasta y que la operación sigue pendiente de autorización. Es una afirmación de la compañía que no recibirá información personal sin excluir o desidentificar. Y es una advertencia de legisladores, sindicatos y organizaciones de privacidad que esas medidas pueden resultar insuficientes para los trabajadores. Confundirlos convertiría una disputa abierta en una conclusión que todavía no existe.
Conclusión
El valor de la operación no está en el precio, sino en el precedente. Los sistemas de IA necesitan datos que representen el trabajo real, y las empresas acumulan exactamente ese tipo de material. Pero una comunicación laboral conserva contexto, derechos y riesgos aunque la organización desaparezca. Si el mercado empieza a tratar archivos de correo y mensajería como activos de entrenamiento, la gobernanza de datos tendrá que contemplar no solo quién puede leerlos hoy, sino quién podría aprender de ellos mañana.
Lecturas relacionadas
Fuentes consultadas
- Comunicado oficial del congresista Steven Horsford sobre la carta a Google y Spirit, 8 de octubre de 2026.
- AFA-CWA: carta del Congreso y objeciones de los trabajadores, 8 de octubre de 2026.
- Reuters: reacción de los legisladores y respuesta de Google, 8 de octubre de 2026.
- Business Insider: informe del ombudsman y límites de su revisión, 5 de octubre de 2026.
- AEPD: La protección de datos en las relaciones laborales.
Fuentes consultadas el 9 de octubre de 2026.


Deja una respuesta