DP-700 · MÓDULO 1 🌊

Introducción a la analítica end-to-end con Microsoft Fabric

La puerta de entrada a Fabric: OneLake, shortcuts, mirroring, workspaces, roles, capacidad y SKUs. Las bases arquitectónicas sobre las que se construye todo lo demás. 🌸

Intermedio Avanzado
🎯

1. Objetivos y encaje en el DP-700

¿Qué te enseña este módulo?

Es la puerta de entrada a Fabric y sienta las bases arquitectónicas sobre las que se construye todo lo demás. La documentación oficial marca tres objetivos:

  1. Identificar las capacidades de Microsoft Fabric.
  2. Implementar Fabric para cubrir necesidades analíticas empresariales.
  3. Describir cómo Fabric soporta capacidades de IA a través de Copilot, data agents y Fabric IQ.

¿Qué peso tiene en el examen?

No es "un dominio" por sí mismo, pero es transversal: OneLake, shortcuts, workspaces, roles y capacidades se cruzan con los tres dominios oficiales.

Dominio del examen%Conceptos de este módulo
Implement and manage an analytics solution30–35%Workspaces, roles, workspace settings, capacidad, OneLake
Ingest and transform data30–35%OneLake shortcuts, mirroring, items de ingesta
Monitor and optimize an analytics solution30–35%Capacity Units, F SKUs, throttling
🎯 Por qué importa: casi cualquier pregunta escenario del DP-700 empieza con "tienes un workspace…" o "tu organización usa una capacidad F64…". Sin este módulo dominado, no puedes contextualizar nada.

Diferencia respecto a la DP-600

  • DP-600: "cómo consumes datos desde OneLake" 🍵
  • DP-700: "cómo diseñas la arquitectura de OneLake, gestionas shortcuts, mirroring, capacidad y seguridad end-to-end" 🏗️
🌊

2. OneLake: el corazón de Fabric

¿Qué es OneLake exactamente?

OneLake es el data lake unificado, lógico y a nivel de tenant que sirve como almacenamiento único para todos los workloads de Fabric.

Frases clave que te pueden preguntar textualmente:

  • "Single logical data lake for the entire organization"
  • "Provisioned automatically with every Fabric tenant"
  • "Built on Azure Data Lake Storage Gen2 (ADLS Gen2)"
  • "One copy of data"

Arquitectura técnica

  • Storage layer: ADLS Gen2
  • Formato por defecto para datos tabulares: Delta Lake
  • Formatos soportados: Delta, Parquet, CSV, JSON y cualquier tipo de fichero
  • APIs: soporta las APIs de ADLS Gen2 y Azure Blob Storage (SDKs, Storage Explorer, incluso Azure Databricks)

Jerarquía de OneLake

Este esquema es CLAVE para entender permisos, dominios y organización:

Tenant (uno por organización, es la raíz de OneLake)
 └── Workspace 1
      ├── Lakehouse A
      │    ├── Tables (datos estructurados en Delta)
      │    └── Files (datos no estructurados)
      ├── Warehouse B
      ├── Notebook C
      └── ...
 └── Workspace 2
      └── ...
  • Un tenant = una organización de Microsoft Entra
  • Un workspace = contenedor lógico con su propia seguridad
  • Un item = lakehouse, warehouse, notebook, pipeline, semantic model, report…
🎯 Un data lake por tenant, siempre: NO puedes tener múltiples OneLakes en un tenant. Es único, provisionado automáticamente. Lo que sí puedes tener son muchos workspaces dentro.

Cross-tenant data sharing

Fabric soporta compartir datos entre tenants sin copiar (external data sharing): el propietario concede permisos OneLake a identidades externas y el receptor crea un shortcut al dato compartido. Las políticas de gobierno se aplican en el origen.

🌸 Analogía kawaii: OneLake es como OneDrive pero para datos. Un espacio compartido donde caben lakehouses, warehouses y eventhouses, y con shortcuts referencias datos de S3, ADLS u otros workspaces… sin copiar.
🔗

3. Shortcuts: acceso a datos sin duplicar

Uno de los temas estrella del examen ⭐

Un shortcut es una referencia lógica (un puntero) a datos que están en otra ubicación. Hacen que los datos aparezcan como si estuvieran en tu workspace local, sin copiarlos. Cualquier engine de Fabric (Spark, SQL, Power BI, KQL) puede leer un shortcut como si fuera local.

🎯 Tipos de shortcuts

Internos (dentro de Fabric): Lakehouses, Warehouses, KQL databases, Mirrored databases, Mirrored Azure Databricks Catalogs, SQL databases, Semantic models. Autorización: identidad del usuario que llama.

Externos (fuera de Fabric): ADLS Gen2, Azure Blob Storage, Amazon S3, S3 compatible (MinIO, Wasabi), Google Cloud Storage, Dataverse, OneDrive/SharePoint, Iceberg tables, on-premises (vía gateway). Autorización: cloud connection con credenciales guardadas.

🎯 Shortcuts en Tables vs Files

UbicaciónRestricciónDatos Delta
TablesSolo top level, sin subcarpetasSe registran automáticamente como tabla (SQL y Spark)
FilesCualquier nivel de la jerarquíaNO se registran como tabla, pero Spark los lee
  • New table shortcut: apunta a una única tabla Delta
  • New schema shortcut: apunta a una carpeta con varias tablas Delta → aparece como schema
  • New shortcut (Files): para cualquier formato y estructura
🎯 Shortcut caching (¡cae seguro!): retención configurable de 1 a 28 días; cada acceso reinicia la retención; ficheros > 1 GB no se cachean; soportado solo para GCS, S3, S3 compatible y on-premises gateway. Se activa en Workspace settings → OneLake tab.
🎯 Pregunta típica: "Un equipo quiere reducir egress costs de leer datos frecuentemente desde S3. ¿Qué configuras?" → Shortcut cache en OneLake workspace settings.

🎯 Consumo de capacidad con shortcuts

  • El acceso consume CU en la capacidad del workspace donde vive el shortcut (el consumidor), NO la del origen.
  • Si apunta a un origen externo (ADLS, S3…), OneLake NO cuenta CU para esa petición externa → la factura el proveedor externo.
  • Si pausas la capacidad donde vive el dato, los shortcuts en otras capacidades siguen funcionando.

Cómo se leen los shortcuts

# PySpark: un shortcut a una tabla Delta en Tables se lee como una tabla más
df = spark.read.format("delta").load("Tables/MyShortcut")
display(df)

# Con Spark SQL
df = spark.sql("SELECT * FROM MyLakehouse.MyShortcut LIMIT 1000")
display(df)
-- T-SQL (SQL analytics endpoint): los shortcuts en Tables aparecen como tablas normales
SELECT TOP (100) *
FROM [MyLakehouse].[dbo].[MyShortcut]
// KQL (Eventhouse): los shortcuts se ven como external tables
external_table('MyShortcut')
| take 100

Shortcut security (modelo simplificado)

Para acceder a datos vía un shortcut externo se requieren dos niveles de permisos: (1) la cloud connection autoriza al usuario que creó el shortcut, y (2) OneLake security autoriza al usuario que consulta. Los permisos de carpeta heredan recursivamente. Además, el usuario necesita Fabric Read sobre el item que contiene el shortcut.

🪞

4. Mirroring: replicación en tiempo casi real

¿Qué es Mirroring?

Mirroring replica continuamente datos de una base de datos operacional externa a OneLake, sin pipelines ETL tradicionales. Bases soportadas: Azure SQL Database, SQL Server, Azure Cosmos DB, Snowflake. El dato replicado se guarda como Delta Lake.

🎯 Mirroring vs Shortcuts (te lo preguntan seguro)

AspectoShortcutMirroring
¿Copia datos?❌ No, referencia✅ Sí, replica continua
Fuente idealStorage (S3, ADLS, GCS) u otro workspace FabricBBDD operacional (SQL, Cosmos, Snowflake)
LatenciaLiveNear real-time
Uso principalAnalítica sin duplicar storageHTAP: analizar datos operacionales
CosteCero copia (solo egress si aplica)Almacenamiento adicional (low-cost)
🎯 Regla mnemotécnica: "Storage → Shortcut. Base de datos operacional → Mirroring."
🏢

5. Workspaces: contenedores lógicos

¿Qué son?

Los workspaces son entidades lógicas que agrupan items y dividen OneLake en contenedores securizables independientemente. Un workspace tiene su propio conjunto de permisos (roles), está asignado a una capacidad, puede tener Git integration y configuraciones específicas (Spark, OneLake, Dataflows Gen2, dominio).

¿Qué NO es un workspace?

  • ❌ NO es un tenant (el tenant es la organización entera)
  • ❌ NO es una capacidad (la capacidad es el poder de cómputo)
  • ❌ NO tiene su propio OneLake (todo vive en el OneLake único del tenant)

Herencia y agrupación

  • Puedes asignar roles a individuos, grupos de seguridad de Entra o service principals.
  • Si alguien está en varios grupos con distintos roles → hereda el rol de mayor permiso.
  • Los grupos anidados también heredan permisos.
🔐

6. Roles del workspace

Los 4 roles (casi de memoria)

  1. Admin: ver, modificar, compartir y gestionar todo, incluyendo permisos.
  2. Member: ver, modificar y compartir. Puede añadir contributors/viewers.
  3. Contributor: ver y modificar. NO puede compartir.
  4. Viewer: solo lectura.
CapabilityAdminMemberContributorViewer
Delete the workspace
Add admins
Add members
Connect workspace to Git
Write data / Create items
Read data via T-SQL / TDS (ReadData)
Read via OneLake APIs y Spark (ReadAll)
🎯 ReadData vs ReadAll (cae seguro): ReadData lee vía SQL analytics endpoint (TDS) y aplica RLS/CLS; ReadAll lee ficheros directamente desde OneLake (Spark/API) y bypasea RLS/CLS. Si el escenario dice "analysts must only see the gold layer via T-SQL" → ReadData. Si dice "engineers must access files directly" → ReadAll.

Detalles operacionales

  • El creador de un workspace es automáticamente Admin.
  • Los cambios de permisos surten efecto la próxima vez que el usuario inicie sesión.
  • Para RLS en Power BI, los usuarios Pro deben tener el rol Viewer (los otros roles bypasean RLS por diseño).
⚙️

7. Configuraciones de workspace clave

Es un objetivo oficial del examen

Se establecen a nivel workspace: License type, OneDrive access, ADLS Gen2 connection, Git integration, Spark settings, OneLake settings (incluye shortcut caching), Dataflows Gen2 settings y Domain assignment.

🎯 Cuatro sub-tareas oficiales del DP-700

  1. Configure Spark workspace settings → pools, runtime, entorno
  2. Configure domain workspace settings → asignar workspace a un dominio
  3. Configure OneLake workspace settings → caching de shortcuts, storage
  4. Configure Dataflows Gen2 workspace settings → engine settings
🎯 Trampa: hay cosas que NO van a nivel workspace: sensitivity labels y endorsement de un item van a nivel item; Copilot y capacity assignments van a nivel tenant/capacity.
🗂️

8. OneLake Catalog: descubrir y gobernar datos

¿Qué es?

La interfaz de descubrimiento y gobierno de Fabric. Permite encontrar y conectar a data sources (respetando permisos), filtrar por workspace/dominio/tipo/keyword, y ver sensitivity labels, metadata y refresh status.

List Shortcuts API

GET https://api.fabric.microsoft.com/v1/workspaces/{workspaceId}/items/{itemId}/shortcuts

Cada shortcut trae: path, target type (OneLake, ADLS Gen2, S3, GCS, S3 Compatible, Dataverse, External Data Share) y detalles de la ubicación destino.

🎨

9. Workloads e items de Fabric

Experiencias organizadas en workloads

WorkloadItems típicos
Data EngineeringLakehouse, Notebook, Spark Job Definition, Environment
Data FactoryData Pipeline, Dataflow Gen2, Copy Job
Data WarehouseWarehouse
Real-Time IntelligenceEventstream, Eventhouse, KQL Database, KQL Queryset, Real-Time Dashboard, Activator
Data ScienceNotebook, ML Model, Experiment
DatabasesSQL Database, Cosmos DB, Mirrored Database
IQ (preview)Ontology
Power BIReport, Semantic Model, Dashboard, Paginated Report

Storage vs Compute items

  • Storage (guardan datos en OneLake): Lakehouse, Warehouse, Eventhouse, SQL Database, Mirrored Database, Semantic Model.
  • Compute/orquestación (procesan pero no almacenan): Notebook, Pipeline, Dataflow, Eventstream, Spark Job Definition.

🎯 Lakehouse vs Warehouse vs Eventhouse vs SQL Database

ItemCuándo usarloMotorFormato
LakehouseEstructurados + no estructurados, big dataSpark + SQL endpointDelta Lake + cualquier fichero
WarehouseAnalítica SQL relacional, T-SQL completoT-SQL puroDelta Lake
EventhouseStreaming, telemetría, logs, tiempo realKQL / KustoKQL DB + Delta
SQL DatabaseOLTP + analítica (mismo motor que Azure SQL DB)T-SQL transaccionalPropio + espejo en OneLake
🔮

10. Fabric IQ, Data Agents y Copilot

Nuevo respecto a la DP-600 (features 2025-2026)

Fabric IQ (preview): workload cuyo item central es la ontología, que define conceptos de negocio, sus relaciones y reglas, para que los AI agents razonen usando el lenguaje del negocio.

WorkloadQué modelaScope
Fabric IQDatos de negocio (ontologías, semantic models, graphs)OneLake y Power BI
Foundry IQEstructurados y no estructurados con permisosAzure, SharePoint, OneLake, web
Work IQSeñales de colaboraciónDocs, meetings, chats, workflows

Fabric Data Agents: interfaces conversacionales que traducen preguntas en NL a queries y consultan lakehouses, warehouses y semantic models. Con una ontología entienden el lenguaje del negocio.

Copilot: asistente generativo transversal (code gen en notebooks, guía de transformación en Data Factory, generación de reports en Power BI).

🎯 Detalles administrativos: Copilot está habilitado por defecto; se desactiva en Admin portal → Tenant settings; se controla por security groups o a nivel capacity. Ver Power BI Free requiere F64+.
💳

11. Capacity, SKUs y facturación

¿Qué es una capacity?

Un pool de recursos computacionales que da servicio a workspaces. Todas las experiencias consumen de la misma capacity unificada. La unidad de medida es la Capacity Unit (CU).

🎯 Tabla de SKUs (memorízala)

SKUCUsPower BI equiv.v-cores
F220.25
F88EM/A11
F3232EM3/A34
F6464P1/A48
F128128P2/A516
F256256P3/A632
F512512P4/A764
F20482048256
🎯 F64 es la frontera mágica: con F64+ los usuarios con Fabric Free pueden ver Power BI items (equivalente a Premium P1). Pregunta típica: "quiero que usuarios sin Pro consuman reports, ¿SKU mínimo?"F64.

🎯 Bursting, Smoothing, Throttling

  • Bursting: un job puede exceder temporalmente la CU disponible; los extras quedan como deuda.
  • Smoothing: la deuda se distribuye en el tiempo (hasta 24h background, 5 min interactivos).
  • Throttling: si la deuda excede límites, Fabric ralentiza o rechaza operaciones (3 niveles progresivos).

F SKU vs P SKU

FeatureF SKUP SKU
FacturaciónPer secondMonthly / yearly
Pause & resume
Resize on-demand
ARM / Terraform
Autoscale Power BI
RoadmapRecomendadoRetirándose

Al pausar una F SKU: el storage se sigue facturando (per GB) y las transacciones se rechazan, pero los shortcuts en otras capacidades siguen funcionando.

👥

12. Roles del equipo de datos

Contexto útil (menos "examinable")

  • Data Engineer 👩‍🔧, ingiere/transforma/carga a OneLake, usa Pipelines, Lakehouses y Notebooks. ¡Tú, ahora mismo! 💕
  • Analytics Engineer, bridge entre engineering y analysis, cura data assets y crea semantic models.
  • Data Analyst, Dataflows, Direct Lake y reports en Power BI.
  • Data Scientist, Notebooks (Python, Spark), modelos ML, Azure ML.
  • Citizen developers, descubren datasets vía OneLake catalog y usan Copilot.
⚠️

13. Trampas típicas y confusiones frecuentes

Los errores clásicos del examen

  • ¿Cuántos OneLakes tengo?Uno por tenant. Múltiples workspaces e items, un solo OneLake.
  • "Los shortcuts copian datos" → ❌ NO copian, son referencias (salvo el caché, que no es copia persistente).
  • Shortcut vs Mirroring → Shortcut = referencia a storage; Mirroring = replicación desde BBDD operacional.
  • "Los Viewers leen datos vía Spark" → ❌ NO. Viewer solo tiene ReadData (TDS), no ReadAll (Spark/OneLake API).
  • "Contributor puede añadir usuarios" → ❌ NO. Solo Admin añade Admins; Admin y Member añaden Contributors/Viewers.
  • "Copilot se desactiva a nivel workspace" → ❌ NO. Es a nivel tenant (Admin portal).
  • "F32 para Fabric Free" → ❌ Necesitas F64+.
  • "El caching funciona para cualquier tipo" → ❌ Solo GCS, S3, S3 compatible y on-prem gateway.
  • "Un shortcut consume CU de la capacidad origen" → ❌ Consume de la del consumidor.
  • "Ficheros grandes se cachean" → ❌ Los > 1 GB no se cachean.
🆚

14. Comparativas clave (chuleta)

Tablas rápidas para repasar

Shortcut interno vs externoInternoExterno
OrigenOtro item Fabric (mismo tenant)Fuera de Fabric
AuthIdentidad del usuario que llamaCloud connection (credenciales guardadas)
Caching✅ (S3, GCS, S3 compat, on-prem)
ReadData vs ReadAllReadDataReadAll
EndpointTDS (SQL analytics endpoint)OneLake API / Spark
Aplica RLS/CLS❌ (bypasea)
Viewer lo tiene
🎀

15. Mini-quiz de cierre

Responde con calma para autoevaluarte. Las respuestas correctas las repasamos en la Guía Maestra de Tips y Trampas. 💕

Pregunta 1. Tu equipo tiene datos muy accedidos en un bucket de Amazon S3 y quiere reducir los egress costs. ¿Qué configuras?

  1. Un pipeline con actividad Copy Data
  2. Mirroring desde S3
  3. Un shortcut con caching activado en Workspace settings → OneLake tab
  4. Un shortcut sin caching

Pregunta 2. Un data engineer necesita leer directamente ficheros Delta desde Spark en un Lakehouse compartido. ¿Permiso mínimo a nivel item?

  1. ReadData
  2. ReadAll
  3. Build
  4. Reshare

Pregunta 3. Quieres que usuarios con Fabric Free vean Power BI reports. ¿SKU mínimo?

  1. F8
  2. F32
  3. F64
  4. F128

Pregunta 4. Datos operacionales en Azure Cosmos DB que cambian continuamente, quieres análisis casi en tiempo real sin pipelines ETL. ¿Qué usas?

  1. Un OneLake shortcut a Cosmos DB
  2. Mirroring de Cosmos DB
  3. Un Dataflow Gen2 con conector Cosmos DB
  4. Un pipeline con Copy activity

Pregunta 5. Un usuario con rol Contributor intenta añadir a otro como Viewer. ¿Qué pasa?

  1. Puede, porque Contributor gestiona Viewers
  2. No puede: solo Admin y Member añaden usuarios
  3. Puede si tiene permiso de Reshare
  4. Puede, pero solo como Contributor

Pregunta 6. Quieres desactivar Copilot para toda la organización. ¿Desde dónde?

  1. Workspace settings → Copilot tab
  2. Admin portal → Tenant settings
  3. Configuración de cada item
  4. Fabric IQ settings

BONUS (más chunga). Un shortcut en Workspace_A (F16) apunta a datos en un Lakehouse de Workspace_B (F32). Un usuario ejecuta una consulta Spark sobre el shortcut. ¿En qué capacidad se consumen los CUs?

  1. F16 (Workspace_A, donde vive el shortcut)
  2. F32 (Workspace_B, donde vive el dato)
  3. Se reparte entre las dos
  4. En el tenant, sin asignarse
🚀 ¡Módulo 1 completado! Ya dominas las bases de Fabric. Sigue con el Módulo 2: Lakehouses para empezar a construir sobre OneLake. 🌸