Mission Lakehouse – Tous les wikis en un coup d'œil
- Databricks
- Databricks
- 5 min de lecture
Emma Colla
Notre mission « Lakehouse » est terminée. À travers une série de 10 articles Wiki, nous avons documenté l'ensemble du parcours, depuis les bases jusqu'à l'exploitation optimisée d'un Databricks Lakehouse moderne avec des données SAP. Cette page vous offre un aperçu concis de chaque étape de la mission.
Table des matières
- Wiki 1 — Vos premiers pas avec Databricks et SAP BDC
- Wiki 2 — L'IA au service de la BI : le reporting moderne dans le Lakehouse de Databricks
- Wiki 3 — SAP Databricks ou Databricks natif : choisir la bonne fusée
- Wiki 4 — Le « Zero Copy Delta Share » chez Databricks expliqué simplement
- Wiki 5 — Transfert des données SAP vers Databricks : un guide stratégique sur l'intégration des données
- Wiki 6 — Le bon carburant : l'évolution des formats de tableaux dans le Lakehouse
- Wiki 7 — BDC Connect : une connexion directe à Databricks, Snowflake et autres
- Wiki 8 — Mission Control : l'architecture du Databricks Unity Catalog
- Wiki 9 — La station spatiale : l'architecture Medallion, au cœur de la mission Lakehouse
- Wiki 10 — Databricks Mosaic AI : des agents IA qui maîtrisent véritablement votre logique métier SAP
- Wiki 11 — FinOps : l'art de maximiser le rapport coût-valeur dans le cloud
- Prêt à décoller ?
Wiki 1 — Vos premiers pas avec Databricks et SAP BDC
Databricks est la plateforme de pointe en matière de science des données et d'IA — et s'intègre parfaitement à l'écosystème SAP. Tandis que SAP fournit les données métier essentielles aux processus, Databricks fait office de moteur d'innovation de pointe. Ce wiki présente les principaux avantages et composants de la plateforme (Unity Catalog, Lakeflow, Mosaic AI), explique en quoi le SAP Business Data Cloud (BDC) va au-delà d’une simple offre logicielle, et met en lumière trois cas d’utilisation concrets : Mosaic AI pour les prévisions, la vue à 360° des données grâce à la combinaison de données SAP et de données tierces, ainsi que le traitement haute performance du Big Data. Le fil conducteur est le flux de données complet, de l’activation à la visualisation dans SAP Analytics Cloud.
Wiki 2 — L'IA au service de la BI : le reporting moderne dans le Lakehouse de Databricks
La Business Intelligence et l’intelligence artificielle ont longtemps été confinées dans des silos distincts : les services de BI traditionnels géraient des entrepôts de données destinés à des analyses rétrospectives, tandis que les data scientists menaient leurs expériences de manière isolée dans des lacs de données, ce qui entraînait des incohérences dans les données et une latence ETL élevée. Le concept « Lakehouse » de Databricks met fin à cette séparation.
Wiki 3 — SAP Databricks ou Databricks natif : choisir la bonne fusée
Ces deux solutions proviennent de la même source, mais elles sont conçues pour des profils de mission différents. SAP Databricks est une solution OEM profondément intégrée, dont la licence est exclusivement fournie par SAP et qui reçoit la précieuse sémantique métier (hiérarchies, conversions de devises, vues CDS) directement via le connecteur BDC, sans qu’il soit nécessaire de reproduire laborieusement la logique. Databricks natif, en revanche, offre une liberté technologique maximale via Azure, AWS et GCP. Le wiki propose une comparaison directe en termes d’objectif, d’intégration, de développement ML, de licence et de pile technologique — et explique pourquoi SAP BDC, sans SAP Databricks, n’offre pas un environnement de travail ML « pro-code » complet destiné aux data scientists.
Wiki 4 — Le « Zero Copy Delta Share » chez Databricks expliqué simplement
La fin du « Data Plumbing » : au lieu de faire circuler laborieusement les données à travers des pipelines, le « Zero-Copy Delta Sharing » permet d’accéder en temps réel aux données SAP dans Databricks — sans créer la moindre copie physique. D’un point de vue technique, cela fonctionne grâce à une élégante procédure d’authentification basée sur REST : un jeton « Bearer » authentifie le client, le serveur BDC fournit un manifeste contenant des URL pré-signées, et les nœuds de travail Databricks chargent de manière ciblée uniquement les colonnes de données nécessaires, directement depuis le SAP File Object Store via des requêtes « Byte-Range ».
Wiki 5 — Transfert des données SAP vers Databricks : un guide stratégique sur l'intégration des données
Comment les données sont-elles intégrées au système ? Le wiki répond à cette question fondamentale en proposant un aperçu complet des six voies d'intégration de SAP vers Databricks.
Wiki 6 — Le bon carburant : l'évolution des formats de tableaux dans le Lakehouse
Tout comme une fusée ne pardonne pas un mauvais carburant, une plateforme de données ne pardonne pas un mauvais choix de format. Le wiki dissipe le malentendu selon lequel Apache Parquet et Delta Lake seraient des technologies concurrentes.
Wiki 7 — BDC Connect : une connexion directe à Databricks, Snowflake et autres
Processus ETL complexes, copies de données coûteuses, perte de la logique métier : tel était jusqu’à présent le lot quotidien de l’intégration des données SAP dans les plateformes cloud modernes. BDC Connect inaugure une nouvelle ère. En tant que connecteur direct entre SAP Business Data Cloud et des plateformes telles que Databricks ou Snowflake, il permet une connectivité en temps réel sans réplication : les données circulent sans être copiées. L’élément décisif est que la précieuse logique métier est directement préservée et n’a pas besoin d’être reconstituée laborieusement dans le système cible. Le wiki explique le fonctionnement technique de BDC Connect, les scénarios d’utilisation auxquels il est particulièrement adapté et la valeur ajoutée concrète qu’il apporte par rapport aux pipelines ETL classiques.
Wiki 8 — Mission Control : l'architecture du Databricks Unity Catalog
Qui accède à quelles données — et comment garantir cela de manière cohérente, sécurisée et sur toutes les plateformes : telle est la mission de Unity Catalog. Véritable « cerveau » de la plateforme Databricks, il gère les autorisations, la traçabilité des données (lineage) et les contrôles d’accès au sein d’une hiérarchie à trois niveaux, et met en œuvre la sécurité au niveau des lignes (Row-Level Security) ainsi que le masquage au niveau des colonnes (Column-Level Masking) sur l’ensemble des plateformes. En association avec Microsoft Entra ID, qui fait office de fournisseur d’identité central, il en résulte un pipeline d’identité sans faille, dans lequel les modifications de rôles ou les désactivations prennent effet immédiatement et de manière cohérente sur l’ensemble de la pile hybride SAP-Databricks. Le wiki explique pourquoi Unity Catalog est la pierre angulaire de la gouvernance universelle — et comment le partage de deltas via le Catalog garantit que la gouvernance ne s’arrête pas aux limites du système.
Wiki 9 — La station spatiale : l'architecture Medallion, au cœur de la mission Lakehouse
Toute station spatiale a besoin d’une structure claire pour que les données, l’équipage et les systèmes puissent fonctionner ensemble de manière efficace. L’architecture Medallion est au cœur de toute implémentation moderne de « lakehouse » : un modèle éprouvé à trois couches qui transforme systématiquement les données brutes en informations pertinentes pour l’entreprise. Ce wiki explique comment les produits de données SAP s’intègrent de manière transparente dans cette architecture via BDC Connect et Delta Sharing — et présente les bonnes pratiques à suivre pour l’exploitation à long terme et le développement continu de la station spatiale.
Wiki 10 — Databricks Mosaic AI : des agents IA qui maîtrisent véritablement votre logique métier SAP
L'accès aux données ne signifie pas la maîtrise de la logique. Un agent IA ne « maîtrise » SAP que lorsqu’il opère au niveau sémantique — au niveau des définitions d’indicateurs, des structures organisationnelles, des sociétés et des règles de consolidation. C’est précisément ce que permet Mosaic AI. Orchestrés via MLflow et formés directement sur des produits de données SAP propriétaires, les agents IA ne se contentent pas d’avoir accès aux données, mais sont ancrés dans une véritable logique métier. Ce wiki met en évidence la différence entre un simple accès aux données et une véritable maîtrise de la logique. À l’aide d’exemples concrets, tels que les analyses automatisées des écarts, les recommandations d’action proactives et la prévision de la demande, il explique ce que les agents IA sont réellement capables de réaliser dans le contexte SAP — et comment Mosaic AI transforme le BDC d’une simple plateforme de données en une véritable usine d’IA.
Wiki 11 — FinOps : l'art de maximiser le rapport coût-valeur dans le cloud
Une stratégie « Lakehouse » n’est viable que si les coûts liés au cloud restent maîtrisés. Le FinOps — Financial Operations — est la discipline qui concilie possibilités techniques et rationalité économique. Ce wiki explique ce que signifie le FinOps et pourquoi il est indispensable à l’ère du cloud, met en lumière les principaux facteurs de coûts dans les environnements Databricks (calcul, stockage, transfert de données, gouvernance) et montre comment le « Zero-Copy Delta Sharing » réduit structurellement les coûts d’infrastructure en éliminant les copies redondantes de données. Des pratiques FinOps concrètes pour SAP BDC — de l’optimisation des charges de travail au dimensionnement intelligent des clusters, en passant par des stratégies de balisage cohérentes — permettent d’associer chaque dépense cloud à une valeur ajoutée mesurable. Le principe : ne pas économiser pour le simple plaisir d’économiser, mais maximiser la valeur par franc investi.
Prêt à décoller ?
Vous avez découvert tous les éléments constitutifs de la mission Lakehouse. Le moment est venu de mettre en œuvre votre propre stratégie en matière de données. Contactez-nous dès maintenant >
Le guide Databricks d'Andreas & Yvonne
Vous voulez toutes les informations importantes en un coup d'œil ?
Téléchargez dès maintenant le guide gratuit de SAP Databricks !
Votre stratégie de données est individuelle - votre conseil devrait l'être aussi
L'introduction du partage delta sans copie est plus qu'une simple implémentation technique : il s'agit d'une étape stratégique vers la modernisation de votre architecture de données. La décision d'utiliser cette technologie et la manière dont vous l'exploiterez dépendent de votre environnement système spécifique, de vos exigences en matière de sécurité et de vos objectifs à long terme en matière d'analyse et d'intelligence artificielle. Il n'existe pas de solution standard dans ce domaine.
Permettez-nous de discuter sans engagement de la manière dont Delta Sharing peut révolutionner l'échange de données dans votre entreprise et exploiter pleinement le potentiel de vos données SAP. Veuillez nous contacter pour un entretien personnalisé.
Publié par :
Emma Colla
Emma Colla
Cet article vous a-t-il plu ?
Cet article vous a-t-il été utile ?
Cliquez sur une étoile pour évaluer !
Note moyenne 4.7 / 5.
Nombre d'évaluations: 27
Aucun vote pour l'instant ! Soyez la première personne à noter ce post !





