Introducción a la analítica end-to-end con Microsoft Fabric
La puerta de entrada a Fabric: OneLake, shortcuts, mirroring, workspaces, roles, capacidad y SKUs. Las bases arquitectónicas sobre las que se construye todo lo demás. 🌸
IntermedioAvanzado
🎯
1. Objetivos y encaje en el DP-700
¿Qué te enseña este módulo?
Es la puerta de entrada a Fabric y sienta las bases arquitectónicas sobre las que se construye todo lo demás. La documentación oficial marca tres objetivos:
Identificar las capacidades de Microsoft Fabric.
Implementar Fabric para cubrir necesidades analíticas empresariales.
Describir cómo Fabric soporta capacidades de IA a través de Copilot, data agents y Fabric IQ.
¿Qué peso tiene en el examen?
No es "un dominio" por sí mismo, pero es transversal: OneLake, shortcuts, workspaces, roles y capacidades se cruzan con los tres dominios oficiales.
🎯 Por qué importa: casi cualquier pregunta escenario del DP-700 empieza con "tienes un workspace…" o "tu organización usa una capacidad F64…". Sin este módulo dominado, no puedes contextualizar nada.
Diferencia respecto a la DP-600
DP-600: "cómo consumes datos desde OneLake" 🍵
DP-700: "cómo diseñas la arquitectura de OneLake, gestionas shortcuts, mirroring, capacidad y seguridad end-to-end" 🏗️
🌊
2. OneLake: el corazón de Fabric
¿Qué es OneLake exactamente?
OneLake es el data lake unificado, lógico y a nivel de tenant que sirve como almacenamiento único para todos los workloads de Fabric.
Frases clave que te pueden preguntar textualmente:
✅ "Single logical data lake for the entire organization"
✅ "Provisioned automatically with every Fabric tenant"
✅ "Built on Azure Data Lake Storage Gen2 (ADLS Gen2)"
✅ "One copy of data"
Arquitectura técnica
Storage layer: ADLS Gen2
Formato por defecto para datos tabulares: Delta Lake
Formatos soportados: Delta, Parquet, CSV, JSON y cualquier tipo de fichero
APIs: soporta las APIs de ADLS Gen2 y Azure Blob Storage (SDKs, Storage Explorer, incluso Azure Databricks)
Jerarquía de OneLake
Este esquema es CLAVE para entender permisos, dominios y organización:
Tenant (uno por organización, es la raíz de OneLake)
└── Workspace 1
├── Lakehouse A
│ ├── Tables (datos estructurados en Delta)
│ └── Files (datos no estructurados)
├── Warehouse B
├── Notebook C
└── ...
└── Workspace 2
└── ...
Un tenant = una organización de Microsoft Entra
Un workspace = contenedor lógico con su propia seguridad
Un item = lakehouse, warehouse, notebook, pipeline, semantic model, report…
🎯 Un data lake por tenant, siempre: NO puedes tener múltiples OneLakes en un tenant. Es único, provisionado automáticamente. Lo que sí puedes tener son muchos workspaces dentro.
Cross-tenant data sharing
Fabric soporta compartir datos entre tenants sin copiar (external data sharing): el propietario concede permisos OneLake a identidades externas y el receptor crea un shortcut al dato compartido. Las políticas de gobierno se aplican en el origen.
🌸 Analogía kawaii: OneLake es como OneDrive pero para datos. Un espacio compartido donde caben lakehouses, warehouses y eventhouses, y con shortcuts referencias datos de S3, ADLS u otros workspaces… sin copiar.
🔗
3. Shortcuts: acceso a datos sin duplicar
Uno de los temas estrella del examen ⭐
Un shortcut es una referencia lógica (un puntero) a datos que están en otra ubicación. Hacen que los datos aparezcan como si estuvieran en tu workspace local, sin copiarlos. Cualquier engine de Fabric (Spark, SQL, Power BI, KQL) puede leer un shortcut como si fuera local.
🎯 Tipos de shortcuts
Internos (dentro de Fabric): Lakehouses, Warehouses, KQL databases, Mirrored databases, Mirrored Azure Databricks Catalogs, SQL databases, Semantic models. Autorización: identidad del usuario que llama.
Se registran automáticamente como tabla (SQL y Spark)
Files
Cualquier nivel de la jerarquía
NO se registran como tabla, pero Spark los lee
New table shortcut: apunta a una única tabla Delta
New schema shortcut: apunta a una carpeta con varias tablas Delta → aparece como schema
New shortcut (Files): para cualquier formato y estructura
🎯 Shortcut caching (¡cae seguro!): retención configurable de 1 a 28 días; cada acceso reinicia la retención; ficheros > 1 GB no se cachean; soportado solo para GCS, S3, S3 compatible y on-premises gateway. Se activa en Workspace settings → OneLake tab.
🎯 Pregunta típica:"Un equipo quiere reducir egress costs de leer datos frecuentemente desde S3. ¿Qué configuras?" → Shortcut cache en OneLake workspace settings.
🎯 Consumo de capacidad con shortcuts
El acceso consume CU en la capacidad del workspace donde vive el shortcut (el consumidor), NO la del origen.
Si apunta a un origen externo (ADLS, S3…), OneLake NO cuenta CU para esa petición externa → la factura el proveedor externo.
Si pausas la capacidad donde vive el dato, los shortcuts en otras capacidades siguen funcionando.
Cómo se leen los shortcuts
# PySpark: un shortcut a una tabla Delta en Tables se lee como una tabla más
df = spark.read.format("delta").load("Tables/MyShortcut")
display(df)
# Con Spark SQL
df = spark.sql("SELECT * FROM MyLakehouse.MyShortcut LIMIT 1000")
display(df)
-- T-SQL (SQL analytics endpoint): los shortcuts en Tables aparecen como tablas normales
SELECT TOP (100) *
FROM [MyLakehouse].[dbo].[MyShortcut]
// KQL (Eventhouse): los shortcuts se ven como external tables
external_table('MyShortcut')
| take 100
Shortcut security (modelo simplificado)
Para acceder a datos vía un shortcut externo se requieren dos niveles de permisos: (1) la cloud connection autoriza al usuario que creó el shortcut, y (2) OneLake security autoriza al usuario que consulta. Los permisos de carpeta heredan recursivamente. Además, el usuario necesita Fabric Read sobre el item que contiene el shortcut.
🪞
4. Mirroring: replicación en tiempo casi real
¿Qué es Mirroring?
Mirroring replica continuamente datos de una base de datos operacional externa a OneLake, sin pipelines ETL tradicionales. Bases soportadas: Azure SQL Database, SQL Server, Azure Cosmos DB, Snowflake. El dato replicado se guarda como Delta Lake.
🎯 Mirroring vs Shortcuts (te lo preguntan seguro)
Aspecto
Shortcut
Mirroring
¿Copia datos?
❌ No, referencia
✅ Sí, replica continua
Fuente ideal
Storage (S3, ADLS, GCS) u otro workspace Fabric
BBDD operacional (SQL, Cosmos, Snowflake)
Latencia
Live
Near real-time
Uso principal
Analítica sin duplicar storage
HTAP: analizar datos operacionales
Coste
Cero copia (solo egress si aplica)
Almacenamiento adicional (low-cost)
🎯 Regla mnemotécnica:"Storage → Shortcut. Base de datos operacional → Mirroring."
🏢
5. Workspaces: contenedores lógicos
¿Qué son?
Los workspaces son entidades lógicas que agrupan items y dividen OneLake en contenedores securizables independientemente. Un workspace tiene su propio conjunto de permisos (roles), está asignado a una capacidad, puede tener Git integration y configuraciones específicas (Spark, OneLake, Dataflows Gen2, dominio).
¿Qué NO es un workspace?
❌ NO es un tenant (el tenant es la organización entera)
❌ NO es una capacidad (la capacidad es el poder de cómputo)
❌ NO tiene su propio OneLake (todo vive en el OneLake único del tenant)
Herencia y agrupación
Puedes asignar roles a individuos, grupos de seguridad de Entra o service principals.
Si alguien está en varios grupos con distintos roles → hereda el rol de mayor permiso.
Los grupos anidados también heredan permisos.
🔐
6. Roles del workspace
Los 4 roles (casi de memoria)
Admin: ver, modificar, compartir y gestionar todo, incluyendo permisos.
Member: ver, modificar y compartir. Puede añadir contributors/viewers.
Contributor: ver y modificar. NO puede compartir.
Viewer: solo lectura.
Capability
Admin
Member
Contributor
Viewer
Delete the workspace
✅
❌
❌
❌
Add admins
✅
❌
❌
❌
Add members
✅
✅
❌
❌
Connect workspace to Git
✅
❌
❌
❌
Write data / Create items
✅
✅
✅
❌
Read data via T-SQL / TDS (ReadData)
✅
✅
✅
✅
Read via OneLake APIs y Spark (ReadAll)
✅
✅
✅
❌
🎯 ReadData vs ReadAll (cae seguro):ReadData lee vía SQL analytics endpoint (TDS) y aplica RLS/CLS; ReadAll lee ficheros directamente desde OneLake (Spark/API) y bypasea RLS/CLS. Si el escenario dice "analysts must only see the gold layer via T-SQL" → ReadData. Si dice "engineers must access files directly" → ReadAll.
Detalles operacionales
El creador de un workspace es automáticamente Admin.
Los cambios de permisos surten efecto la próxima vez que el usuario inicie sesión.
Para RLS en Power BI, los usuarios Pro deben tener el rol Viewer (los otros roles bypasean RLS por diseño).
⚙️
7. Configuraciones de workspace clave
Es un objetivo oficial del examen
Se establecen a nivel workspace: License type, OneDrive access, ADLS Gen2 connection, Git integration, Spark settings, OneLake settings (incluye shortcut caching), Dataflows Gen2 settings y Domain assignment.
🎯 Trampa: hay cosas que NO van a nivel workspace: sensitivity labels y endorsement de un item van a nivel item; Copilot y capacity assignments van a nivel tenant/capacity.
🗂️
8. OneLake Catalog: descubrir y gobernar datos
¿Qué es?
La interfaz de descubrimiento y gobierno de Fabric. Permite encontrar y conectar a data sources (respetando permisos), filtrar por workspace/dominio/tipo/keyword, y ver sensitivity labels, metadata y refresh status.
List Shortcuts API
GET https://api.fabric.microsoft.com/v1/workspaces/{workspaceId}/items/{itemId}/shortcuts
Cada shortcut trae: path, target type (OneLake, ADLS Gen2, S3, GCS, S3 Compatible, Dataverse, External Data Share) y detalles de la ubicación destino.
Storage (guardan datos en OneLake): Lakehouse, Warehouse, Eventhouse, SQL Database, Mirrored Database, Semantic Model.
Compute/orquestación (procesan pero no almacenan): Notebook, Pipeline, Dataflow, Eventstream, Spark Job Definition.
🎯 Lakehouse vs Warehouse vs Eventhouse vs SQL Database
Item
Cuándo usarlo
Motor
Formato
Lakehouse
Estructurados + no estructurados, big data
Spark + SQL endpoint
Delta Lake + cualquier fichero
Warehouse
Analítica SQL relacional, T-SQL completo
T-SQL puro
Delta Lake
Eventhouse
Streaming, telemetría, logs, tiempo real
KQL / Kusto
KQL DB + Delta
SQL Database
OLTP + analítica (mismo motor que Azure SQL DB)
T-SQL transaccional
Propio + espejo en OneLake
🔮
10. Fabric IQ, Data Agents y Copilot
Nuevo respecto a la DP-600 (features 2025-2026)
Fabric IQ (preview): workload cuyo item central es la ontología, que define conceptos de negocio, sus relaciones y reglas, para que los AI agents razonen usando el lenguaje del negocio.
Workload
Qué modela
Scope
Fabric IQ
Datos de negocio (ontologías, semantic models, graphs)
OneLake y Power BI
Foundry IQ
Estructurados y no estructurados con permisos
Azure, SharePoint, OneLake, web
Work IQ
Señales de colaboración
Docs, meetings, chats, workflows
Fabric Data Agents: interfaces conversacionales que traducen preguntas en NL a queries y consultan lakehouses, warehouses y semantic models. Con una ontología entienden el lenguaje del negocio.
Copilot: asistente generativo transversal (code gen en notebooks, guía de transformación en Data Factory, generación de reports en Power BI).
🎯 Detalles administrativos: Copilot está habilitado por defecto; se desactiva en Admin portal → Tenant settings; se controla por security groups o a nivel capacity. Ver Power BI Free requiere F64+.
💳
11. Capacity, SKUs y facturación
¿Qué es una capacity?
Un pool de recursos computacionales que da servicio a workspaces. Todas las experiencias consumen de la misma capacity unificada. La unidad de medida es la Capacity Unit (CU).
🎯 Tabla de SKUs (memorízala)
SKU
CUs
Power BI equiv.
v-cores
F2
2
–
0.25
F8
8
EM/A1
1
F32
32
EM3/A3
4
F64
64
P1/A4
8
F128
128
P2/A5
16
F256
256
P3/A6
32
F512
512
P4/A7
64
F2048
2048
–
256
🎯 F64 es la frontera mágica: con F64+ los usuarios con Fabric Free pueden ver Power BI items (equivalente a Premium P1). Pregunta típica: "quiero que usuarios sin Pro consuman reports, ¿SKU mínimo?" → F64.
🎯 Bursting, Smoothing, Throttling
Bursting: un job puede exceder temporalmente la CU disponible; los extras quedan como deuda.
Smoothing: la deuda se distribuye en el tiempo (hasta 24h background, 5 min interactivos).
Throttling: si la deuda excede límites, Fabric ralentiza o rechaza operaciones (3 niveles progresivos).
F SKU vs P SKU
Feature
F SKU
P SKU
Facturación
Per second
Monthly / yearly
Pause & resume
✅
❌
Resize on-demand
✅
❌
ARM / Terraform
✅
❌
Autoscale Power BI
❌
✅
Roadmap
Recomendado
Retirándose
Al pausar una F SKU: el storage se sigue facturando (per GB) y las transacciones se rechazan, pero los shortcuts en otras capacidades siguen funcionando.
👥
12. Roles del equipo de datos
Contexto útil (menos "examinable")
Data Engineer 👩🔧, ingiere/transforma/carga a OneLake, usa Pipelines, Lakehouses y Notebooks. ¡Tú, ahora mismo! 💕
Analytics Engineer, bridge entre engineering y analysis, cura data assets y crea semantic models.
Data Analyst, Dataflows, Direct Lake y reports en Power BI.
Data Scientist, Notebooks (Python, Spark), modelos ML, Azure ML.
Citizen developers, descubren datasets vía OneLake catalog y usan Copilot.
⚠️
13. Trampas típicas y confusiones frecuentes
Los errores clásicos del examen
¿Cuántos OneLakes tengo? → Uno por tenant. Múltiples workspaces e items, un solo OneLake.
"Los shortcuts copian datos" → ❌ NO copian, son referencias (salvo el caché, que no es copia persistente).
Shortcut vs Mirroring → Shortcut = referencia a storage; Mirroring = replicación desde BBDD operacional.
"Los Viewers leen datos vía Spark" → ❌ NO. Viewer solo tiene ReadData (TDS), no ReadAll (Spark/OneLake API).
"Contributor puede añadir usuarios" → ❌ NO. Solo Admin añade Admins; Admin y Member añaden Contributors/Viewers.
"Copilot se desactiva a nivel workspace" → ❌ NO. Es a nivel tenant (Admin portal).
"F32 para Fabric Free" → ❌ Necesitas F64+.
"El caching funciona para cualquier tipo" → ❌ Solo GCS, S3, S3 compatible y on-prem gateway.
"Un shortcut consume CU de la capacidad origen" → ❌ Consume de la del consumidor.
"Ficheros grandes se cachean" → ❌ Los > 1 GB no se cachean.
Pregunta 1. Tu equipo tiene datos muy accedidos en un bucket de Amazon S3 y quiere reducir los egress costs. ¿Qué configuras?
Un pipeline con actividad Copy Data
Mirroring desde S3
Un shortcut con caching activado en Workspace settings → OneLake tab
Un shortcut sin caching
Pregunta 2. Un data engineer necesita leer directamente ficheros Delta desde Spark en un Lakehouse compartido. ¿Permiso mínimo a nivel item?
ReadData
ReadAll
Build
Reshare
Pregunta 3. Quieres que usuarios con Fabric Free vean Power BI reports. ¿SKU mínimo?
F8
F32
F64
F128
Pregunta 4. Datos operacionales en Azure Cosmos DB que cambian continuamente, quieres análisis casi en tiempo real sin pipelines ETL. ¿Qué usas?
Un OneLake shortcut a Cosmos DB
Mirroring de Cosmos DB
Un Dataflow Gen2 con conector Cosmos DB
Un pipeline con Copy activity
Pregunta 5. Un usuario con rol Contributor intenta añadir a otro como Viewer. ¿Qué pasa?
Puede, porque Contributor gestiona Viewers
No puede: solo Admin y Member añaden usuarios
Puede si tiene permiso de Reshare
Puede, pero solo como Contributor
Pregunta 6. Quieres desactivar Copilot para toda la organización. ¿Desde dónde?
Workspace settings → Copilot tab
Admin portal → Tenant settings
Configuración de cada item
Fabric IQ settings
BONUS (más chunga). Un shortcut en Workspace_A (F16) apunta a datos en un Lakehouse de Workspace_B (F32). Un usuario ejecuta una consulta Spark sobre el shortcut. ¿En qué capacidad se consumen los CUs?
F16 (Workspace_A, donde vive el shortcut)
F32 (Workspace_B, donde vive el dato)
Se reparte entre las dos
En el tenant, sin asignarse
🚀 ¡Módulo 1 completado! Ya dominas las bases de Fabric. Sigue con el Módulo 2: Lakehouses para empezar a construir sobre OneLake. 🌸