1. Introducción
Big Data designa el tratamiento de conjuntos de datos cuyo volumen, velocidad, variedad o complejidad exige herramientas capaces de almacenar, procesar y analizar información a una escala superior a la que normalmente puede manejar una aplicación tradicional.
No existe una cantidad fija de gigabytes, terabytes o petabytes a partir de la cual pueda afirmarse automáticamente que estamos ante Big Data. El concepto es relativo a la infraestructura disponible, a la velocidad requerida y al tipo de operaciones que deben realizarse.
El elemento decisivo no es únicamente que existan muchos datos, sino que el problema requiera una arquitectura escalable, procesamiento paralelo, almacenamiento distribuido, análisis en tiempo real o integración de numerosas fuentes heterogéneas.
Desde el punto de vista jurídico, Big Data no constituye una zona exenta de regulación. Cuando los datos permiten identificar directa o indirectamente a personas, crear perfiles, inferir características o adoptar decisiones respecto de ellas, resultan aplicables las normas sobre protección de datos personales, seguridad de la información, defensa del consumidor, propiedad intelectual, contratación informática y responsabilidad.
Idea central: la dimensión técnica de un sistema de Big Data no desplaza las obligaciones jurídicas. Cuanto mayor es la concentración y capacidad de correlación de datos, mayor suele ser el riesgo para los derechos de las personas.
2. Características del Big Data
El concepto suele explicarse mediante las denominadas “V” del Big Data.
Volumen
Cantidad de información almacenada o procesada. Puede abarcar millones de transacciones, registros, imágenes, videos, documentos o eventos.
Velocidad
Rapidez con la que los datos son generados, transmitidos y analizados. Puede requerir procesamiento por lotes o en tiempo real.
Variedad
Diversidad de formatos: datos estructurados, semiestructurados y no estructurados.
Veracidad
Nivel de exactitud, consistencia, actualidad y confiabilidad de los datos.
Valor
Capacidad de transformar los datos en conocimiento útil para una decisión, servicio o investigación.
Variabilidad
Cambios en la estructura, significado, contexto o velocidad de los datos.
2.1. Tipos de datos
| Tipo | Características | Ejemplos |
|---|---|---|
| Estructurados | Poseen un esquema fijo y suelen organizarse en filas y columnas. | Bases SQL, planillas, registros de facturación. |
| Semiestructurados | Tienen etiquetas o metadatos, pero no una estructura tabular rígida. | JSON, XML, correos electrónicos, logs. |
| No estructurados | No siguen un esquema uniforme previamente definido. | Textos, PDF, fotografías, videos, audios. |
Más datos no significa mejores decisiones. Un sistema que procesa información incompleta, desactualizada o sesgada puede producir resultados técnicamente sofisticados, pero materialmente incorrectos.
3. Big Data, inteligencia artificial y aprendizaje automático
Big Data, inteligencia artificial y aprendizaje automático son conceptos relacionados, pero no equivalentes.
| Concepto | Función principal |
|---|---|
| Big Data | Obtención, almacenamiento, integración, procesamiento y análisis de grandes conjuntos de datos. |
| Inteligencia artificial | Sistemas capaces de realizar tareas de clasificación, predicción, percepción, generación o apoyo a decisiones. |
| Machine Learning | Rama de la inteligencia artificial que construye modelos a partir de patrones encontrados en los datos. |
En muchos proyectos, Big Data aporta la infraestructura y los datos, mientras que los algoritmos de aprendizaje automático utilizan esa información para clasificar, estimar probabilidades o generar predicciones.
4. Arquitectura técnica de un sistema de Big Data
Una arquitectura típica comprende varias capas conectadas entre sí.
4.1. Fuentes de datos
Los datos pueden provenir de:
- bases internas;
- archivos CSV, Excel, JSON o XML;
- aplicaciones web y móviles;
- sensores e Internet de las cosas;
- cámaras y sistemas biométricos;
- interfaces de programación o APIs;
- redes sociales;
- servicios de terceros;
- datos abiertos gubernamentales;
- expedientes electrónicos;
- sistemas empresariales ERP y CRM.
Antes de incorporar una fuente deben analizarse la legitimidad del acceso, las condiciones de uso, la titularidad, la calidad, la presencia de datos personales, la finalidad y las restricciones contractuales.
4.2. Ingesta
La ingesta es el proceso mediante el cual los datos ingresan a la plataforma. Puede realizarse mediante consultas SQL, carga de archivos, APIs, colas de mensajes, replicación de bases o captura de cambios.
Procesamiento por lotes
Los datos se acumulan y se procesan en intervalos definidos. Ejemplo: generación nocturna de informes de ventas.
Procesamiento en tiempo real
Los eventos se analizan mientras se producen. Ejemplo: detección inmediata de una operación bancaria potencialmente fraudulenta.
4.3. Almacenamiento
Base de datos relacional
Organiza la información en tablas relacionadas. PostgreSQL, MySQL, MariaDB, SQL Server y Oracle continúan siendo opciones adecuadas para numerosos proyectos.
Data Warehouse
Repositorio estructurado y optimizado para consultas analíticas, informes históricos e inteligencia empresarial.
Data Lake
Repositorio que conserva grandes cantidades de información en su formato original o con transformaciones mínimas.
Sin catálogo, metadatos, controles de calidad y reglas de gobierno, un data lake puede convertirse en un data swamp: un depósito desorganizado, difícil de comprender y jurídicamente riesgoso.
Lakehouse
Combina la flexibilidad del data lake con características de control, transacciones y rendimiento propias de un data warehouse.
Almacenamiento distribuido
Los archivos se reparten entre varios nodos para aumentar capacidad, tolerancia a fallos y velocidad de procesamiento.
4.4. Procesamiento ETL y ELT
| Modelo | Secuencia | Uso habitual |
|---|---|---|
| ETL | Extraer → transformar → cargar. | Data warehouses tradicionales y cargas controladas. |
| ELT | Extraer → cargar → transformar. | Plataformas modernas y servicios de nube escalables. |
4.5. Tipos de análisis
- Descriptivo: determina qué ocurrió.
- Diagnóstico: procura explicar por qué ocurrió.
- Predictivo: estima qué podría ocurrir.
- Prescriptivo: sugiere acciones posibles.
4.6. Visualización
Los resultados pueden presentarse mediante gráficos, mapas, tableros, indicadores y alertas. Una visualización incorrecta puede inducir a error, incluso cuando los datos de origen son correctos.
4.7. Orquestación
La orquestación coordina tareas como obtención, validación, transformación, análisis, generación de informes y emisión de alertas.
5. Herramientas y lenguajes
5.1. Lenguajes de programación
| Lenguaje | Usos principales | Ventajas | Limitaciones |
|---|---|---|---|
| SQL | Consultas, filtros, agregaciones, informes. | Estándar de facto para datos estructurados. | No resuelve por sí solo todo el procesamiento avanzado. |
| Python | Análisis, automatización, machine learning, APIs. | Gran ecosistema y facilidad de aprendizaje. | Menor rendimiento nativo en tareas intensivas. |
| Scala | Spark, sistemas distribuidos, backend. | Tipado estático e integración con JVM. | Curva de aprendizaje más elevada. |
| Java | Infraestructura empresarial y servicios. | Madurez, portabilidad y rendimiento. | Mayor verbosidad que otros lenguajes. |
| R | Estadística, investigación y visualización. | Excelente ecosistema estadístico. | Menos apropiado para ciertos sistemas productivos. |
| C/C++ | Motores, bibliotecas y procesamiento de alto rendimiento. | Velocidad y control de memoria. | Mayor complejidad y riesgo de errores de memoria. |
| Go | Servicios distribuidos, APIs y concurrencia. | Simplicidad y buen rendimiento. | Ecosistema de ciencia de datos menos amplio. |
| TypeScript | Aplicaciones web, tableros y servicios backend. | Integración directa con interfaces web. | No suele ser la primera opción para análisis estadístico intensivo. |
5.2. Plataformas de procesamiento
Apache Spark
Motor de procesamiento distribuido utilizado para SQL, análisis, aprendizaje automático y flujos de datos.
Apache Hadoop
Ecosistema para almacenamiento y procesamiento distribuido, especialmente relevante en infraestructuras de gran escala.
Apache Kafka
Plataforma de transmisión de eventos, integración de sistemas y recepción continua de datos.
Apache Flink
Motor orientado al procesamiento continuo y con estado de flujos de datos.
Dask y Ray
Herramientas para distribuir o paralelizar tareas en Python.
Apache Airflow
Plataforma para definir, programar y supervisar flujos de trabajo.
5.3. Bases de datos NoSQL
- MongoDB: documentos con estructura flexible.
- Cassandra: alta disponibilidad y distribución masiva.
- Redis: caché y operaciones de baja latencia.
- Elasticsearch/OpenSearch: búsqueda e indexación.
- Neo4j: relaciones y análisis de grafos.
5.4. Formatos de datos
| Formato | Uso | Observaciones |
|---|---|---|
| CSV | Intercambio simple de datos tabulares. | Compatible, pero poco eficiente para grandes volúmenes. |
| JSON | APIs y documentos semiestructurados. | Legible, flexible y ampliamente utilizado. |
| Parquet | Análisis columnar. | Compresión eficiente y lectura selectiva de columnas. |
| Avro | Eventos y sistemas con esquemas. | Frecuente en arquitecturas con Kafka. |
| ORC | Almacenamiento analítico columnar. | Utilizado en ecosistemas Hadoop. |
5.5. Visualización y gobierno
Para visualización pueden utilizarse Power BI, Tableau, Apache Superset, Metabase, Grafana, Matplotlib o Plotly. Para calidad, catálogo y gobierno pueden emplearse Great Expectations, Soda, OpenMetadata, DataHub, Apache Atlas o herramientas equivalentes.
6. Selección de arquitectura según el proyecto
| Escenario | Herramientas posibles |
|---|---|
| Estudio profesional o pequeña empresa | PostgreSQL, Python, pandas o Polars, archivos Parquet, Metabase y copias de seguridad cifradas. |
| Organización mediana | Almacenamiento de objetos, Parquet, data warehouse, Airflow, Spark o Dask, catálogo de datos y gestión centralizada de identidades. |
| Procesamiento en tiempo real | Kafka, Flink o Spark Structured Streaming, almacenamiento histórico, base de baja latencia y Grafana. |
La mejor arquitectura no es la más compleja, sino la que satisface los requisitos con el menor costo, riesgo y esfuerzo de mantenimiento.
7. Aspectos jurídicos en Uruguay
7.1. Protección de datos personales
La principal norma aplicable es la Ley N.º 18.331, de Protección de Datos Personales y Acción de Habeas Data, reglamentada principalmente por el Decreto N.º 414/009 y complementada, entre otras disposiciones, por la Ley N.º 19.670 y el Decreto N.º 64/020.
La regulación no depende del tamaño de la base. Una planilla con pocos registros puede estar sometida a la ley si contiene información personal, mientras que un conjunto masivo de datos meteorológicos podría quedar fuera de su ámbito específico.
La cuestión jurídica fundamental es determinar si los datos permiten identificar o hacer identificable a una persona física, directa o indirectamente.
7.2. Identificación directa e indirecta
La identificación puede producirse mediante nombre, cédula, fotografía, correo electrónico o teléfono, pero también a través de combinaciones de edad, ubicación, profesión, historial de compras, dirección IP, dispositivo, horarios o patrones de movilidad.
7.3. Anonimización y seudonimización
| Técnica | Descripción | Consecuencia |
|---|---|---|
| Anonimización | Impide razonablemente identificar o reidentificar a una persona. | Puede excluir el conjunto del régimen de datos personales. |
| Seudonimización | Sustituye identificadores por códigos, conservando la reversibilidad. | Los datos continúan siendo personales. |
Eliminar nombre y cédula no garantiza anonimato. La combinación de localidad, edad, profesión, fecha y otros atributos puede permitir la reidentificación.
7.4. Principios aplicables
- legalidad;
- veracidad y calidad;
- finalidad;
- consentimiento informado, cuando corresponda;
- seguridad;
- reserva;
- responsabilidad.
Finalidad
Los datos deben utilizarse para fines legítimos, explícitos y compatibles con aquellos que justificaron su obtención. La acumulación indiscriminada “por si algún día sirve” aumenta riesgos técnicos y jurídicos.
Proporcionalidad y minimización
Debe limitarse la recolección a la información necesaria para la finalidad declarada.
Veracidad
Los datos deben ser exactos, adecuados y actualizados, especialmente cuando se utilizan para clasificar personas o adoptar decisiones.
7.5. Base jurídica del tratamiento
La organización debe identificar qué habilita jurídicamente cada tratamiento: consentimiento, ejecución contractual, obligación legal, competencia pública, información proveniente de una fuente legalmente habilitada u otra excepción.
7.6. Datos sensibles
La Ley N.º 18.331 reconoce una protección reforzada para datos que revelan, entre otros aspectos:
- origen racial o étnico;
- preferencias políticas;
- convicciones religiosas o morales;
- afiliación sindical;
- información relativa a la salud;
- vida sexual.
También requieren especial cautela los datos biométricos, financieros, penales, de menores, de geolocalización y laborales.
7.7. Elaboración de perfiles
Un perfil es una representación de características, hábitos, intereses o probabilidades atribuidas a una persona. Puede utilizarse para publicidad, crédito, selección laboral, prevención de fraude, seguros o segmentación.
Un modelo puede discriminar aunque no utilice expresamente una categoría protegida. El domicilio, idioma, centro educativo o patrón de consumo pueden funcionar como variables indirectas o sustitutivas.
7.8. Decisiones automatizadas
El artículo 16 de la Ley N.º 18.331 contempla la impugnación de valoraciones personales basadas en tratamientos automatizados. Cuando una decisión produce efectos relevantes, deben existir mecanismos de información, revisión humana, corrección e impugnación.
Una explicación adecuada puede incluir:
- finalidad del sistema;
- datos utilizados;
- variables principales;
- criterios decisivos;
- consecuencias del resultado;
- procedimiento de revisión.
7.9. Privacidad desde el diseño y por defecto
El Decreto N.º 64/020 exige incorporar medidas de protección desde la etapa de diseño. Esto comprende minimización, disociación, seudonimización, control de accesos, plazos de conservación, mecanismos de ejercicio de derechos y planes de contingencia.
7.10. Evaluación de impacto
Debe analizarse la necesidad de una evaluación de impacto cuando el tratamiento implique riesgos elevados, grandes volúmenes, perfiles, datos sensibles, menores, grupos vulnerables o transferencias internacionales complejas.
La evaluación debe considerar:
- descripción del tratamiento;
- finalidad;
- base jurídica;
- riesgos para las personas;
- medidas de seguridad;
- mecanismos para demostrar cumplimiento.
7.11. Delegado de Protección de Datos
El Decreto N.º 64/020 prevé la designación de delegado para entidades públicas y determinadas entidades privadas. A estos efectos, considera gran volumen el tratamiento que comprende datos personales de más de 35.000 personas.
Este umbral no exime de las demás obligaciones a tratamientos de menor escala.
7.12. Seguridad y vulneraciones
Los sistemas deben proteger confidencialidad, integridad, disponibilidad, autenticidad, trazabilidad y resiliencia.
Las medidas recomendables incluyen:
- cifrado en tránsito y en reposo;
- autenticación multifactor;
- principio de menor privilegio;
- segmentación de redes;
- registro y auditoría de accesos;
- copias de seguridad y pruebas de restauración;
- gestión de vulnerabilidades;
- respuesta a incidentes;
- control de proveedores;
- eliminación segura.
El Decreto N.º 64/020 establece que una vulneración que incida en la protección de datos debe comunicarse a la URCDP dentro del plazo máximo previsto por la reglamentación, sin perjuicio de informar a los titulares cuando exista una afectación significativa.
7.13. Transferencias internacionales y nube
El uso de servicios en la nube exige analizar la localización de los datos, jurisdicciones, subencargados, accesos, auditorías, continuidad, recuperación y eliminación al finalizar el contrato.
El artículo 23 de la Ley N.º 18.331 regula la transferencia internacional de datos y limita las transferencias hacia países u organismos que no proporcionen un nivel adecuado de protección, salvo las excepciones y mecanismos admitidos.
7.14. Registro de bases
La arquitectura distribuida no elimina la obligación de identificar y registrar jurídicamente las bases o tratamientos cuando corresponda.
7.15. Datos abiertos e información pública
La Ley N.º 18.381 regula el acceso a la información pública. Los datos abiertos pueden utilizarse en investigación, transparencia, periodismo de datos, planificación y aplicaciones cívicas, siempre que se respeten los límites relativos a datos personales, información reservada, secretos comerciales y seguridad.
7.16. Propiedad intelectual
Deben distinguirse los datos fácticos, la selección u organización original de una base, el software, los modelos, la documentación y los resultados.
Los contratos deberían regular:
- titularidad del código;
- titularidad de las bases;
- licencias de uso;
- derechos sobre transformaciones;
- reutilización de resultados;
- acceso a documentación;
- devolución y eliminación;
- responsabilidad de las partes.
7.17. Web scraping
El scraping consiste en extraer información automáticamente desde sitios web. El carácter público de una página no implica que toda recolección y reutilización sea jurídicamente irrestricta.
Deben analizarse:
- protección de datos personales;
- términos de uso;
- propiedad intelectual;
- licencias;
- carga generada sobre el servidor;
- mecanismos de autenticación;
- finalidad y proporcionalidad.
No deben eludirse controles de acceso, mecanismos de autenticación o barreras técnicas. Cuando exista una API autorizada, su utilización suele ser la opción técnica y jurídicamente más segura.
7.18. Responsabilidad
Los daños pueden originarse en filtraciones, datos incorrectos, discriminación, decisiones automatizadas erróneas, falta de supervisión, incumplimiento contractual, conservación excesiva o fallas de seguridad.
Según el caso, pueden resultar responsables el responsable del tratamiento, el encargado, el proveedor de nube, el desarrollador, la organización usuaria o terceros que suministraron los datos.
La intervención de un algoritmo no elimina la responsabilidad humana, profesional, empresarial o institucional.
8. Gobierno de datos
El gobierno de datos comprende políticas, funciones y controles mediante los cuales una organización administra su información.
8.1. Catálogo
Debe documentar nombre, definición, responsable, origen, formato, sensibilidad, finalidad, retención, calidad y restricciones de cada conjunto.
8.2. Linaje
Permite reconstruir el recorrido del dato desde la fuente hasta el informe, modelo o decisión final.
8.3. Control de acceso
Debe aplicarse el principio de menor privilegio y diferenciar administradores, desarrolladores, analistas, auditores, usuarios y proveedores.
8.4. Conservación
Cada categoría debe contar con un período de retención. Finalizada la necesidad, corresponde eliminar, anonimizar, archivar con restricciones o bloquear cuando proceda.
9. Ejemplos de aplicación
Sector público
Planificación territorial, movilidad, presupuesto, salud, estadísticas y evaluación de políticas públicas.
Banca y finanzas
Prevención de fraude, análisis crediticio, monitoreo de transacciones y segmentación.
Salud
Epidemiología, gestión hospitalaria, investigación y apoyo diagnóstico, con protección reforzada de datos sensibles.
Comercio
Inventario, recomendaciones, logística, análisis de demanda y prevención de fraude.
Agro e industria
Sensores, clima, mantenimiento predictivo, trazabilidad y optimización de recursos.
Actividad jurídica
Búsqueda jurisprudencial, clasificación documental, estadísticas judiciales y análisis de duración de procesos.
10. Metodología de implementación
- Definir el problema: qué decisión o proceso se pretende mejorar.
- Inventariar los datos: fuente, formato, volumen, calidad y titularidad.
- Identificar riesgos: privacidad, seguridad, sesgo y dependencia.
- Diseñar una arquitectura mínima: evitar complejidad innecesaria.
- Crear una prueba de concepto: usar datos controlados o anonimizados.
- Validar resultados: exactitud, robustez, sesgo y reproducibilidad.
- Implementar controles: permisos, cifrado, auditoría y contratos.
- Monitorear: calidad, seguridad, deriva y cumplimiento.
11. Lista de control
- La finalidad está claramente definida.
- Solo se recolectan los datos necesarios.
- Se identificó si existen datos personales o sensibles.
- Se determinó la base jurídica del tratamiento.
- Se evaluó si se elaboran perfiles.
- Se identificaron decisiones automatizadas.
- Se analizó la necesidad de una evaluación de impacto.
- Se verificó si corresponde designar delegado.
- Se revisó la inscripción de bases.
- Se identificaron transferencias internacionales.
- Los contratos distribuyen responsabilidades.
- Existen controles de acceso y cifrado.
- Se cuenta con copias de seguridad verificadas.
- Existe un plan de respuesta a incidentes.
- Se documenta el linaje de los datos.
- Se fijaron plazos de conservación.
- Se pueden atender los derechos de los titulares.
- Se probó el riesgo de reidentificación.
- Los resultados pueden ser explicados y revisados.
12. Conclusión
Big Data combina arquitectura informática, programación, estadística, bases de datos, seguridad, organización y Derecho. Un proyecto técnicamente sofisticado puede fracasar si utiliza datos de mala calidad, carece de una finalidad legítima, no documenta sus procesos, no puede explicar sus resultados o vulnera derechos.
En Uruguay, la implementación debe considerar principalmente la Ley N.º 18.331, sus decretos reglamentarios, la normativa de ciberseguridad, el acceso a la información pública, los datos abiertos, la propiedad intelectual y la contratación informática.
La legalidad no debe añadirse al final como una formalidad. Debe formar parte de los requisitos, la arquitectura, el código, los contratos, las pruebas y la operación cotidiana del sistema.
13. Normativa y documentación recomendada
- Ley N.º 18.331 — Protección de Datos Personales y Acción de Habeas Data .
- Decreto N.º 414/009 — Reglamentación de la Ley N.º 18.331 .
- Decreto N.º 64/020 — Responsabilidad proactiva, privacidad desde el diseño y delegado .
- Ley N.º 18.381 — Derecho de Acceso a la Información Pública .
- Unidad Reguladora y de Control de Datos Personales .
- Apache Spark — Documentación oficial .
- Apache Kafka — Documentación oficial .
- Apache Flink — Documentación oficial .
- Apache Airflow — Documentación oficial .