“La industria tecnológica nos vende la narrativa de que la inteligencia artificial salvará nuestras lenguas maternas de la extinción inminente, cuando en los hechos el control del código fuente y las patentes derivadas de nuestra palabra quedan atrincheradas en granjas de servidores corporativos en el extranjero”.

Por Kiado

Territorio Digital, 25 de junio, 2026.- En las montañas de la Sierra Norte, la neblina acompaña la voz de una abuela que envía un audio de WhatsApp en zapoteco a sus familiares del otro lado de la frontera. A kilómetros de ahí, una radio comunitaria transmite en Mixe los acuerdos de la asamblea para la próxima fiesta. Creemos que esas palabras viajan cobijadas por la intimidad del territorio. Sin embargo, en el trayecto, esos audios son aspirados silenciosamente por una maquinaria invisible que no busca entender nuestro dolor ni nuestra alegría: busca devorar nuestra voz para entrenar a sus máquinas.

La industria tecnológica global nos vende la narrativa de la “inclusión” como una panacea democrática. La historia de América Latina, sin embargo, nos ha enseñado a ser profundamente cautelosos: muchas veces, la inclusión forzada ha sido apenas el preludio del despojo. El avance del capitalismo no opera únicamente a través de la explotación en el campo o la fábrica; su motor histórico más profundo es la apropiación.

Como advierte Nancy Fraser, el capital siempre ha necesitado confiscar y expropiar de forma gratuita aquello que se encuentra fuera de la lógica del mercado para poder acumular riqueza. En el pasado, saqueó las tierras comunales y se apropió del trabajo no remunerado; hoy, en la era algorítmica, este “capitalismo caníbal” ejecuta un colonialismo digital centrado en el extractivismo de los datos de los pueblos originarios. Bajo esta lógica de plataformización, la riqueza biocultural se transfigura en activo financiero: los datos son el nuevo petróleo, y los seres humanos, la naturaleza y sus lenguas se convierten en vastos yacimientos de extracción.

Para las grandes corporaciones tecnológicas, las lenguas indígenas y los saberes del Sur Global no son patrimonios vivos, sino recursos listos para ser minados. A través del web scraping —raspado masivo de datos—, estas empresas ingresan a nuestros territorios virtuales para absorber fonéticas, esquilmar diseños textiles y catalogar conocimientos ecológicos tradicionales, de manera sistemática y sin nuestro consentimiento libre, previo e informado.

El caso más documentado es el de Whisper, herramienta de OpenAI para reconocimiento de voz y transcripción multilingüe: fue entrenada con más de 680,000 horas de audio disponibles en internet, corpus que incluye de manera significativa registros de lenguas de pueblos originarios obtenidos sin atribución ni pago.

Aun cuando el desglose exacto por procedencia no es público, la escala del corpus y la ausencia de cualquier protocolo de consentimiento ilustran con precisión lo que Nick Couldry y Ulises Mejías definen como colonialismo de datos: toman gratuitamente nuestra riqueza biocultural, la encierran en la “caja negra” de un algoritmo de propiedad privada, y nos la revenden en forma de aplicaciones de traducción automática.

La paradoja más hiriente es que este saqueo llega disfrazado con el discurso del salvataje. La industria tecnológica nos vende la narrativa de que la inteligencia artificial salvará nuestras lenguas maternas de la extinción inminente, cuando en los hechos el control del código fuente y las patentes derivadas de nuestra palabra quedan atrincheradas en granjas de servidores corporativos en el extranjero. Los hablantes Zapotecos, Mixes o Triquis son reducidos a ser el combustible gratuito de una maquinaria algorítmica que jamás les rendirá cuentas.

Frente a este modelo, sin embargo, comienzan a emerger alternativas que demuestran que otro ecosistema de información es posible. Mozilla Data Collective —plataforma incubada por Mozilla Foundation y construida sobre la experiencia acumulada de Common Voice— rechaza ver a los hablantes como minas de extracción: ofrece a comunidades y organizaciones de todo el mundo la posibilidad de compartir sus datos bajo sus propias condiciones, reteniendo la propiedad y decidiendo quién accede y en qué términos.

Con más de 286 lenguas representadas en su corpus, muchas de ellas sin presencia significativa en los grandes modelos de inteligencia artificial, demuestra que el dilema no es regalar los datos o desaparecer. En el contexto latinoamericano, experiencias como las redes de radios comunitarias indígenas, los protocolos CARE aplicados a archivos orales, o iniciativas como Local Contexts en territorios mexicanos apuntan en la misma dirección: los datos pueden quedarse en casa.

Como han señalado quienes construyen estas alternativas, si una megacorporación tecnológica es propietaria de tus datos, puede acabar con tu existencia con solo pulsar un botón; pero si la comunidad mantiene el control de su memoria colectiva, nadie tiene el poder de borrarla.

En nuestra propia geografía oaxaqueña, el extractivismo de datos no siempre llega con el rostro de una corporación de Silicon Valley. A veces se presenta con el lenguaje técnico de la sostenibilidad agrícola y la promesa de “soluciones para productores de todo el mundo.” La alianza entre CIMMYT —organización internacional de investigación agrícola financiada por la Fundación Gates, gobiernos donantes y la Comisión Europea, entre otros— y Calice, empresa argentina de agricultura computacional fundada en 2022 con 2.5 millones de dólares en capital de riesgo aportado por fondos como Astanor, Draper Cygnus y GrainCorp Ventures, es un caso que merece lectura crítica.

La colaboración busca unificar diversos conjuntos de datos —desde experimentos de campo y prácticas de manejo, hasta información ambiental y observaciones de agricultores— dentro de un marco computacional único. En palabras del Director Científico de Calice, el objetivo es “conectar múltiples universos de datos en uno solo.” Ese universo ya tiene nombre y dirección: mixtecadatos.org, repositorio que centraliza más de una década de información territorial sobre los sistemas productivos, los suelos y los medios de vida de los pequeños agricultores de la región.

El propio sitio reconoce que “esta información pertenece, en primer lugar, a los productores que la compartieron originalmente” —pero el acceso a esos mismos datos se gestiona mediante acuerdos institucionales sin ningún mecanismo visible de participación comunitaria en su gobernanza. Lo que esa declaración no dice es quién posee el universo resultante, quién decide qué se muestra y a quién, ni bajo qué condiciones esos datos podrán ser licenciados a terceros.

El modelo de negocio de Calice es explícito: licenciar su plataforma NODES a empresas multinacionales del agro, con foco estratégico en mercados de Estados Unidos y Europa. Los agricultores mixtecos cuyas voces y territorios construyeron ese repositorio no aparecen como actores con autoridad sobre él: aparecen como fuente, como el combustible de una maquinaria que, una vez integrada, opera bajo lógicas corporativas muy distintas a las de la asamblea comunitaria.

Que el repositorio haya nacido bajo el aval académico de instituciones reconocidas no resuelve la pregunta, sino que la agudiza: las comunidades no entregaron su memoria territorial a una empresa de agtech; la entregaron a investigadores. La distancia entre ambos destinos es exactamente el vacío que ningún protocolo de gobernanza ha cerrado.

¿Cómo protegemos entonces nuestra memoria lingüística y territorial sin caer en un aislamiento forzado? La respuesta no puede ser el repliegue silencioso, sino la disputa frontal por la infraestructura de los datos: construir arquitecturas donde la tecnología obedezca a los tiempos y condiciones de la asamblea comunitaria, donde el consentimiento no sea un trámite de entrada sino una condición permanente de la relación, y donde los beneficios —económicos, epistémicos, políticos— se queden en el territorio que los hizo posibles. Nuestra voz no es un recurso descartable. Es la respiración innegociable de nuestro territorio.

Bibliografía

–CIMMYT. (s.f.). Nuestros donantes. https://www.cimmyt.org/es/acerca-del-cimmyt/nuestros-donantes/

–Couldry, N. y Mejías, U. (2019). The Costs of Connection: How Data Is Colonizing Human Life and Appropriating It for Capitalism. Stanford University Press.

–Cruz, K. (2026). Ponencia magistral: Inteligencia Artificial, protección de datos y gobernanza de datos en pueblos y comunidades indígenas de México. ENESO, UNAM Oaxaca.

–Fraser, N. (2022). Capitalismo caníbal: Cómo nuestro sistema está devorando la democracia, el cuidado y el planeta y qué podemos hacer al respecto. Siglo XXI Editores.

–Mixtecadata. (2025). Paisaje de datos de la Mixteca: espacio colaborativo. https://mixtecadatos.org

–Mozilla Data Collective. (2025). Data platform for human agency and fair value exchange. https://mozilladatacollective.com

–Mozilla Data Collective. (2025, 30 de septiembre). Common Voice 23.0 live on Mozilla Data Collective. https://community.mozilladatacollective.com/common-voice-23-0-live-on-mozilla-data-collective/

–Ser Campo. (2025, 13 de octubre). CIMMYT y Calice se unen para aplicar modelos computacionales para un maíz y trigo más resilientes al clima. https://sercampo.ar/cimmyt-y-calice-se-unen-para-aplicar-modelos-computacionales-para-un-maiz-y-trigo-mas-resilientes-al-clima/

Comunicación intercultural para un mundo más humano y diverso.

Calle Los Cipreses 350 – San Juan de Miraflores – Lima – Perú.

Servindi.org es un sitio web especializado en promover el diálogo intercultural sobre temas de interés indígena y ambiental.

Las ediciones son de responsabilidad propia y no compromete la opinión de ninguna organización indígena local, nacional o internacional.

Los contenidos de este sitio se encuentran bajo licencia : Reconocimiento al autor, Sin fin de lucro, Compartir igual Sindique las noticias (RSS).



Fuente: www.servindi.org

Deja un comentario