Derecho informático y ciencia de datos

Big Data: aspectos técnicos y jurídicos

Concepto, arquitectura, lenguajes, bases de datos, procesamiento distribuido, herramientas de análisis y régimen jurídico aplicable en Uruguay.

1. Introducción

Big Data designa el tratamiento de conjuntos de datos cuyo volumen, velocidad, variedad o complejidad exige herramientas capaces de almacenar, procesar y analizar información a una escala superior a la que normalmente puede manejar una aplicación tradicional.

No existe una cantidad fija de gigabytes, terabytes o petabytes a partir de la cual pueda afirmarse automáticamente que estamos ante Big Data. El concepto es relativo a la infraestructura disponible, a la velocidad requerida y al tipo de operaciones que deben realizarse.

El elemento decisivo no es únicamente que existan muchos datos, sino que el problema requiera una arquitectura escalable, procesamiento paralelo, almacenamiento distribuido, análisis en tiempo real o integración de numerosas fuentes heterogéneas.

Desde el punto de vista jurídico, Big Data no constituye una zona exenta de regulación. Cuando los datos permiten identificar directa o indirectamente a personas, crear perfiles, inferir características o adoptar decisiones respecto de ellas, resultan aplicables las normas sobre protección de datos personales, seguridad de la información, defensa del consumidor, propiedad intelectual, contratación informática y responsabilidad.

2. Características del Big Data

El concepto suele explicarse mediante las denominadas “V” del Big Data.

Volumen

Cantidad de información almacenada o procesada. Puede abarcar millones de transacciones, registros, imágenes, videos, documentos o eventos.

Velocidad

Rapidez con la que los datos son generados, transmitidos y analizados. Puede requerir procesamiento por lotes o en tiempo real.

Variedad

Diversidad de formatos: datos estructurados, semiestructurados y no estructurados.

Veracidad

Nivel de exactitud, consistencia, actualidad y confiabilidad de los datos.

Valor

Capacidad de transformar los datos en conocimiento útil para una decisión, servicio o investigación.

Variabilidad

Cambios en la estructura, significado, contexto o velocidad de los datos.

2.1. Tipos de datos

Clasificación técnica de los datos
Tipo Características Ejemplos
Estructurados Poseen un esquema fijo y suelen organizarse en filas y columnas. Bases SQL, planillas, registros de facturación.
Semiestructurados Tienen etiquetas o metadatos, pero no una estructura tabular rígida. JSON, XML, correos electrónicos, logs.
No estructurados No siguen un esquema uniforme previamente definido. Textos, PDF, fotografías, videos, audios.

Más datos no significa mejores decisiones. Un sistema que procesa información incompleta, desactualizada o sesgada puede producir resultados técnicamente sofisticados, pero materialmente incorrectos.

3. Big Data, inteligencia artificial y aprendizaje automático

Big Data, inteligencia artificial y aprendizaje automático son conceptos relacionados, pero no equivalentes.

Diferencias principales
Concepto Función principal
Big Data Obtención, almacenamiento, integración, procesamiento y análisis de grandes conjuntos de datos.
Inteligencia artificial Sistemas capaces de realizar tareas de clasificación, predicción, percepción, generación o apoyo a decisiones.
Machine Learning Rama de la inteligencia artificial que construye modelos a partir de patrones encontrados en los datos.

En muchos proyectos, Big Data aporta la infraestructura y los datos, mientras que los algoritmos de aprendizaje automático utilizan esa información para clasificar, estimar probabilidades o generar predicciones.

4. Arquitectura técnica de un sistema de Big Data

Una arquitectura típica comprende varias capas conectadas entre sí.

Fuentes
Ingesta
Almacenamiento
Procesamiento
Análisis y visualización

4.1. Fuentes de datos

Los datos pueden provenir de:

  • bases internas;
  • archivos CSV, Excel, JSON o XML;
  • aplicaciones web y móviles;
  • sensores e Internet de las cosas;
  • cámaras y sistemas biométricos;
  • interfaces de programación o APIs;
  • redes sociales;
  • servicios de terceros;
  • datos abiertos gubernamentales;
  • expedientes electrónicos;
  • sistemas empresariales ERP y CRM.

4.2. Ingesta

La ingesta es el proceso mediante el cual los datos ingresan a la plataforma. Puede realizarse mediante consultas SQL, carga de archivos, APIs, colas de mensajes, replicación de bases o captura de cambios.

Procesamiento por lotes

Los datos se acumulan y se procesan en intervalos definidos. Ejemplo: generación nocturna de informes de ventas.

Procesamiento en tiempo real

Los eventos se analizan mientras se producen. Ejemplo: detección inmediata de una operación bancaria potencialmente fraudulenta.

4.3. Almacenamiento

Base de datos relacional

Organiza la información en tablas relacionadas. PostgreSQL, MySQL, MariaDB, SQL Server y Oracle continúan siendo opciones adecuadas para numerosos proyectos.

Data Warehouse

Repositorio estructurado y optimizado para consultas analíticas, informes históricos e inteligencia empresarial.

Data Lake

Repositorio que conserva grandes cantidades de información en su formato original o con transformaciones mínimas.

Sin catálogo, metadatos, controles de calidad y reglas de gobierno, un data lake puede convertirse en un data swamp: un depósito desorganizado, difícil de comprender y jurídicamente riesgoso.

Lakehouse

Combina la flexibilidad del data lake con características de control, transacciones y rendimiento propias de un data warehouse.

Almacenamiento distribuido

Los archivos se reparten entre varios nodos para aumentar capacidad, tolerancia a fallos y velocidad de procesamiento.

4.4. Procesamiento ETL y ELT

ETL y ELT
Modelo Secuencia Uso habitual
ETL Extraer → transformar → cargar. Data warehouses tradicionales y cargas controladas.
ELT Extraer → cargar → transformar. Plataformas modernas y servicios de nube escalables.

4.5. Tipos de análisis

  • Descriptivo: determina qué ocurrió.
  • Diagnóstico: procura explicar por qué ocurrió.
  • Predictivo: estima qué podría ocurrir.
  • Prescriptivo: sugiere acciones posibles.

4.6. Visualización

Los resultados pueden presentarse mediante gráficos, mapas, tableros, indicadores y alertas. Una visualización incorrecta puede inducir a error, incluso cuando los datos de origen son correctos.

4.7. Orquestación

La orquestación coordina tareas como obtención, validación, transformación, análisis, generación de informes y emisión de alertas.

5. Herramientas y lenguajes

5.1. Lenguajes de programación

Lenguajes usados en proyectos de Big Data
Lenguaje Usos principales Ventajas Limitaciones
SQL Consultas, filtros, agregaciones, informes. Estándar de facto para datos estructurados. No resuelve por sí solo todo el procesamiento avanzado.
Python Análisis, automatización, machine learning, APIs. Gran ecosistema y facilidad de aprendizaje. Menor rendimiento nativo en tareas intensivas.
Scala Spark, sistemas distribuidos, backend. Tipado estático e integración con JVM. Curva de aprendizaje más elevada.
Java Infraestructura empresarial y servicios. Madurez, portabilidad y rendimiento. Mayor verbosidad que otros lenguajes.
R Estadística, investigación y visualización. Excelente ecosistema estadístico. Menos apropiado para ciertos sistemas productivos.
C/C++ Motores, bibliotecas y procesamiento de alto rendimiento. Velocidad y control de memoria. Mayor complejidad y riesgo de errores de memoria.
Go Servicios distribuidos, APIs y concurrencia. Simplicidad y buen rendimiento. Ecosistema de ciencia de datos menos amplio.
TypeScript Aplicaciones web, tableros y servicios backend. Integración directa con interfaces web. No suele ser la primera opción para análisis estadístico intensivo.

5.2. Plataformas de procesamiento

Apache Spark

Motor de procesamiento distribuido utilizado para SQL, análisis, aprendizaje automático y flujos de datos.

Apache Hadoop

Ecosistema para almacenamiento y procesamiento distribuido, especialmente relevante en infraestructuras de gran escala.

Apache Kafka

Plataforma de transmisión de eventos, integración de sistemas y recepción continua de datos.

Apache Flink

Motor orientado al procesamiento continuo y con estado de flujos de datos.

Dask y Ray

Herramientas para distribuir o paralelizar tareas en Python.

Apache Airflow

Plataforma para definir, programar y supervisar flujos de trabajo.

5.3. Bases de datos NoSQL

  • MongoDB: documentos con estructura flexible.
  • Cassandra: alta disponibilidad y distribución masiva.
  • Redis: caché y operaciones de baja latencia.
  • Elasticsearch/OpenSearch: búsqueda e indexación.
  • Neo4j: relaciones y análisis de grafos.

5.4. Formatos de datos

Formatos habituales
Formato Uso Observaciones
CSV Intercambio simple de datos tabulares. Compatible, pero poco eficiente para grandes volúmenes.
JSON APIs y documentos semiestructurados. Legible, flexible y ampliamente utilizado.
Parquet Análisis columnar. Compresión eficiente y lectura selectiva de columnas.
Avro Eventos y sistemas con esquemas. Frecuente en arquitecturas con Kafka.
ORC Almacenamiento analítico columnar. Utilizado en ecosistemas Hadoop.

5.5. Visualización y gobierno

Para visualización pueden utilizarse Power BI, Tableau, Apache Superset, Metabase, Grafana, Matplotlib o Plotly. Para calidad, catálogo y gobierno pueden emplearse Great Expectations, Soda, OpenMetadata, DataHub, Apache Atlas o herramientas equivalentes.

6. Selección de arquitectura según el proyecto

Arquitecturas orientativas
Escenario Herramientas posibles
Estudio profesional o pequeña empresa PostgreSQL, Python, pandas o Polars, archivos Parquet, Metabase y copias de seguridad cifradas.
Organización mediana Almacenamiento de objetos, Parquet, data warehouse, Airflow, Spark o Dask, catálogo de datos y gestión centralizada de identidades.
Procesamiento en tiempo real Kafka, Flink o Spark Structured Streaming, almacenamiento histórico, base de baja latencia y Grafana.

La mejor arquitectura no es la más compleja, sino la que satisface los requisitos con el menor costo, riesgo y esfuerzo de mantenimiento.

7. Aspectos jurídicos en Uruguay

7.1. Protección de datos personales

La principal norma aplicable es la Ley N.º 18.331, de Protección de Datos Personales y Acción de Habeas Data, reglamentada principalmente por el Decreto N.º 414/009 y complementada, entre otras disposiciones, por la Ley N.º 19.670 y el Decreto N.º 64/020.

La regulación no depende del tamaño de la base. Una planilla con pocos registros puede estar sometida a la ley si contiene información personal, mientras que un conjunto masivo de datos meteorológicos podría quedar fuera de su ámbito específico.

7.2. Identificación directa e indirecta

La identificación puede producirse mediante nombre, cédula, fotografía, correo electrónico o teléfono, pero también a través de combinaciones de edad, ubicación, profesión, historial de compras, dirección IP, dispositivo, horarios o patrones de movilidad.

7.3. Anonimización y seudonimización

Diferencia jurídica
Técnica Descripción Consecuencia
Anonimización Impide razonablemente identificar o reidentificar a una persona. Puede excluir el conjunto del régimen de datos personales.
Seudonimización Sustituye identificadores por códigos, conservando la reversibilidad. Los datos continúan siendo personales.

Eliminar nombre y cédula no garantiza anonimato. La combinación de localidad, edad, profesión, fecha y otros atributos puede permitir la reidentificación.

7.4. Principios aplicables

  • legalidad;
  • veracidad y calidad;
  • finalidad;
  • consentimiento informado, cuando corresponda;
  • seguridad;
  • reserva;
  • responsabilidad.

Finalidad

Los datos deben utilizarse para fines legítimos, explícitos y compatibles con aquellos que justificaron su obtención. La acumulación indiscriminada “por si algún día sirve” aumenta riesgos técnicos y jurídicos.

Proporcionalidad y minimización

Debe limitarse la recolección a la información necesaria para la finalidad declarada.

Veracidad

Los datos deben ser exactos, adecuados y actualizados, especialmente cuando se utilizan para clasificar personas o adoptar decisiones.

7.5. Base jurídica del tratamiento

La organización debe identificar qué habilita jurídicamente cada tratamiento: consentimiento, ejecución contractual, obligación legal, competencia pública, información proveniente de una fuente legalmente habilitada u otra excepción.

7.6. Datos sensibles

La Ley N.º 18.331 reconoce una protección reforzada para datos que revelan, entre otros aspectos:

  • origen racial o étnico;
  • preferencias políticas;
  • convicciones religiosas o morales;
  • afiliación sindical;
  • información relativa a la salud;
  • vida sexual.

También requieren especial cautela los datos biométricos, financieros, penales, de menores, de geolocalización y laborales.

7.7. Elaboración de perfiles

Un perfil es una representación de características, hábitos, intereses o probabilidades atribuidas a una persona. Puede utilizarse para publicidad, crédito, selección laboral, prevención de fraude, seguros o segmentación.

Un modelo puede discriminar aunque no utilice expresamente una categoría protegida. El domicilio, idioma, centro educativo o patrón de consumo pueden funcionar como variables indirectas o sustitutivas.

7.8. Decisiones automatizadas

El artículo 16 de la Ley N.º 18.331 contempla la impugnación de valoraciones personales basadas en tratamientos automatizados. Cuando una decisión produce efectos relevantes, deben existir mecanismos de información, revisión humana, corrección e impugnación.

Una explicación adecuada puede incluir:

  • finalidad del sistema;
  • datos utilizados;
  • variables principales;
  • criterios decisivos;
  • consecuencias del resultado;
  • procedimiento de revisión.

7.9. Privacidad desde el diseño y por defecto

El Decreto N.º 64/020 exige incorporar medidas de protección desde la etapa de diseño. Esto comprende minimización, disociación, seudonimización, control de accesos, plazos de conservación, mecanismos de ejercicio de derechos y planes de contingencia.

7.10. Evaluación de impacto

Debe analizarse la necesidad de una evaluación de impacto cuando el tratamiento implique riesgos elevados, grandes volúmenes, perfiles, datos sensibles, menores, grupos vulnerables o transferencias internacionales complejas.

La evaluación debe considerar:

  1. descripción del tratamiento;
  2. finalidad;
  3. base jurídica;
  4. riesgos para las personas;
  5. medidas de seguridad;
  6. mecanismos para demostrar cumplimiento.

7.11. Delegado de Protección de Datos

El Decreto N.º 64/020 prevé la designación de delegado para entidades públicas y determinadas entidades privadas. A estos efectos, considera gran volumen el tratamiento que comprende datos personales de más de 35.000 personas.

Este umbral no exime de las demás obligaciones a tratamientos de menor escala.

7.12. Seguridad y vulneraciones

Los sistemas deben proteger confidencialidad, integridad, disponibilidad, autenticidad, trazabilidad y resiliencia.

Las medidas recomendables incluyen:

  • cifrado en tránsito y en reposo;
  • autenticación multifactor;
  • principio de menor privilegio;
  • segmentación de redes;
  • registro y auditoría de accesos;
  • copias de seguridad y pruebas de restauración;
  • gestión de vulnerabilidades;
  • respuesta a incidentes;
  • control de proveedores;
  • eliminación segura.

7.13. Transferencias internacionales y nube

El uso de servicios en la nube exige analizar la localización de los datos, jurisdicciones, subencargados, accesos, auditorías, continuidad, recuperación y eliminación al finalizar el contrato.

El artículo 23 de la Ley N.º 18.331 regula la transferencia internacional de datos y limita las transferencias hacia países u organismos que no proporcionen un nivel adecuado de protección, salvo las excepciones y mecanismos admitidos.

7.14. Registro de bases

La arquitectura distribuida no elimina la obligación de identificar y registrar jurídicamente las bases o tratamientos cuando corresponda.

7.15. Datos abiertos e información pública

La Ley N.º 18.381 regula el acceso a la información pública. Los datos abiertos pueden utilizarse en investigación, transparencia, periodismo de datos, planificación y aplicaciones cívicas, siempre que se respeten los límites relativos a datos personales, información reservada, secretos comerciales y seguridad.

7.16. Propiedad intelectual

Deben distinguirse los datos fácticos, la selección u organización original de una base, el software, los modelos, la documentación y los resultados.

Los contratos deberían regular:

  • titularidad del código;
  • titularidad de las bases;
  • licencias de uso;
  • derechos sobre transformaciones;
  • reutilización de resultados;
  • acceso a documentación;
  • devolución y eliminación;
  • responsabilidad de las partes.

7.17. Web scraping

El scraping consiste en extraer información automáticamente desde sitios web. El carácter público de una página no implica que toda recolección y reutilización sea jurídicamente irrestricta.

Deben analizarse:

  • protección de datos personales;
  • términos de uso;
  • propiedad intelectual;
  • licencias;
  • carga generada sobre el servidor;
  • mecanismos de autenticación;
  • finalidad y proporcionalidad.

No deben eludirse controles de acceso, mecanismos de autenticación o barreras técnicas. Cuando exista una API autorizada, su utilización suele ser la opción técnica y jurídicamente más segura.

7.18. Responsabilidad

Los daños pueden originarse en filtraciones, datos incorrectos, discriminación, decisiones automatizadas erróneas, falta de supervisión, incumplimiento contractual, conservación excesiva o fallas de seguridad.

Según el caso, pueden resultar responsables el responsable del tratamiento, el encargado, el proveedor de nube, el desarrollador, la organización usuaria o terceros que suministraron los datos.

8. Gobierno de datos

El gobierno de datos comprende políticas, funciones y controles mediante los cuales una organización administra su información.

8.1. Catálogo

Debe documentar nombre, definición, responsable, origen, formato, sensibilidad, finalidad, retención, calidad y restricciones de cada conjunto.

8.2. Linaje

Permite reconstruir el recorrido del dato desde la fuente hasta el informe, modelo o decisión final.

8.3. Control de acceso

Debe aplicarse el principio de menor privilegio y diferenciar administradores, desarrolladores, analistas, auditores, usuarios y proveedores.

8.4. Conservación

Cada categoría debe contar con un período de retención. Finalizada la necesidad, corresponde eliminar, anonimizar, archivar con restricciones o bloquear cuando proceda.

9. Ejemplos de aplicación

Sector público

Planificación territorial, movilidad, presupuesto, salud, estadísticas y evaluación de políticas públicas.

Banca y finanzas

Prevención de fraude, análisis crediticio, monitoreo de transacciones y segmentación.

Salud

Epidemiología, gestión hospitalaria, investigación y apoyo diagnóstico, con protección reforzada de datos sensibles.

Comercio

Inventario, recomendaciones, logística, análisis de demanda y prevención de fraude.

Agro e industria

Sensores, clima, mantenimiento predictivo, trazabilidad y optimización de recursos.

Actividad jurídica

Búsqueda jurisprudencial, clasificación documental, estadísticas judiciales y análisis de duración de procesos.

10. Metodología de implementación

  1. Definir el problema: qué decisión o proceso se pretende mejorar.
  2. Inventariar los datos: fuente, formato, volumen, calidad y titularidad.
  3. Identificar riesgos: privacidad, seguridad, sesgo y dependencia.
  4. Diseñar una arquitectura mínima: evitar complejidad innecesaria.
  5. Crear una prueba de concepto: usar datos controlados o anonimizados.
  6. Validar resultados: exactitud, robustez, sesgo y reproducibilidad.
  7. Implementar controles: permisos, cifrado, auditoría y contratos.
  8. Monitorear: calidad, seguridad, deriva y cumplimiento.

11. Lista de control

  • La finalidad está claramente definida.
  • Solo se recolectan los datos necesarios.
  • Se identificó si existen datos personales o sensibles.
  • Se determinó la base jurídica del tratamiento.
  • Se evaluó si se elaboran perfiles.
  • Se identificaron decisiones automatizadas.
  • Se analizó la necesidad de una evaluación de impacto.
  • Se verificó si corresponde designar delegado.
  • Se revisó la inscripción de bases.
  • Se identificaron transferencias internacionales.
  • Los contratos distribuyen responsabilidades.
  • Existen controles de acceso y cifrado.
  • Se cuenta con copias de seguridad verificadas.
  • Existe un plan de respuesta a incidentes.
  • Se documenta el linaje de los datos.
  • Se fijaron plazos de conservación.
  • Se pueden atender los derechos de los titulares.
  • Se probó el riesgo de reidentificación.
  • Los resultados pueden ser explicados y revisados.

12. Conclusión

Big Data combina arquitectura informática, programación, estadística, bases de datos, seguridad, organización y Derecho. Un proyecto técnicamente sofisticado puede fracasar si utiliza datos de mala calidad, carece de una finalidad legítima, no documenta sus procesos, no puede explicar sus resultados o vulnera derechos.

En Uruguay, la implementación debe considerar principalmente la Ley N.º 18.331, sus decretos reglamentarios, la normativa de ciberseguridad, el acceso a la información pública, los datos abiertos, la propiedad intelectual y la contratación informática.

La legalidad no debe añadirse al final como una formalidad. Debe formar parte de los requisitos, la arquitectura, el código, los contratos, las pruebas y la operación cotidiana del sistema.

13. Normativa y documentación recomendada

Este contenido tiene finalidad informativa y académica. La aplicación a un caso concreto requiere analizar los hechos, la finalidad del tratamiento, la arquitectura utilizada y la normativa vigente.