Sparkle Reference Data Architecture

De referentiearchitectuur van Sparkle

Sparkle heeft zijn eigen pragmatische referentiearchitectuur ontwikkeld op basis van jarenlange ervaring, standaarden en industry best practices. Onze referentiearchitectuur dient als startpunt om een klantspecifieke data-architectuur te ontwikkelen. We geloven niet dat één standaardoplossing het best past voor alle klanten, maar onze architectuur verplicht om vooraf na te denken over alle verschillende mogelijkheden. Ze laat toe om voor elk van de potentiële lagen een heel bewuste beslissing te nemen en te beslissen of het (al dan niet al) relevant is. Ons doel is om succes voorspelbaar te maken en voort te bouwen op de ervaring die we door de jaren heen hebben opgebouwd.

Waarom de referentiearchitectuur van Sparkle gebruiken?

De referentiearchitectuur van Sparkle heeft verschillende voordelen en doelen:

  • Faciliteer discussies en ontwerpen door de data-architectuur te visualiseren
  • Afstemmen van verschillende stakeholders rond een gemeenschappelijke en gedeelde terminologie
  • Vooruitplannen: Denk van bij het begin na over de huidige bekende en verwachte toekomstige uitdagingen waarmee de architectuur moet omgaan
  • Prioriteren: Laat toe om prioriteiten te stellen en de architectuur af te stemmen op de prioriteiten van de organisatie
  • Zorg voor afstemming en inbedding binnen de enterprise architecture
Het is een gelaagde architectuur die gericht is op flexibiliteit, schaalbaarheid, kostenefficiëntie en performantie. Door een duidelijk doel voor elke laag en door duidelijke regels te definiëren over welke transformaties waar gebeuren, hebben we een voorspelbare architectuur die klaar is om je organisatie naar het volgende niveau van datamaturiteit te tillen.

De referentiearchitectuur van Sparkle in detail

Databronnen

Deze laag bestaat uit alle databronnen die potentieel interessante informatie voor de organisatie bevatten. Terwijl deze laag traditioneel vooral bestaat uit de OLTP-databases van de organisatie (inclusief ERP, CRM, ), is er veel innovatie in dit domein. Tegenwoordig kan ze ook open data omvatten, data die via API's wordt opgehaald of via een service bus wordt aangeleverd, real-time datastromen, socialemediadata, IoT-data, ongestructureerde tekstbestanden en meer.

Data Lake

Een data lake is een opslagrepository die een enorme hoeveelheid ruwe data in zijn oorspronkelijke formaat bevat. Een data lake kan gestructureerde, semigestructureerde en ongestructureerde data bevatten. Er is doorgaans geen schema on write, maar schema on read. Een data lake is vaak een kostenefficiënte manier om data op te slaan.

Operationele laag

De operationele laag bevat gedetailleerde informatie over operationele transacties en wordt doorgaans in (near) real-time geladen. Het doel is om operationele informatiebehoeften te ondersteunen. De dataretentie in de operationele laag is doorgaans beperkt in de tijd. Historische wijzigingen worden niet bijgehouden.

Foundation-laag

De foundation-laag integreert en historiseert de data afkomstig van verschillende databronnen. De foundation-laag wordt vaak gemodelleerd volgens de Data Vault 2.0-methodologie. De foundation-laag slaat een volledige geschiedenis van de data op atomair niveau op. Business rules die voor de hele organisatie gelden, worden in deze laag toegepast om consistentie in de hele organisatie te garanderen.

Presentatielaag

In de presentatielaag wordt de data (virtueel) getransformeerd naar een datamodel dat gebaseerd is op de informatiebehoeften van de organisatie en gericht is op reporting. Dit zijn doorgaans star schemas. In combinatie met een foundation-laag kan de presentatielaag altijd van nul worden heropgebouwd. Zo kan snel worden ingespeeld op nieuwe informatiebehoeften. Business rules die enkel voor bepaalde afdelingen gelden, worden hier ook doorgaans gedefinieerd.

Toegangslaag

De toegangslaag maakt de data beschikbaar voor verschillende soorten consumptie. Ze bestaat vooral uit de tools die mensen gebruiken om alle beschikbare informatie te analyseren en erover te rapporteren. Typisch gebruik omvat strategische scorecards, operationele dashboards, pixel-perfect reporting, ad-hoc queries, multidimensionale analyses en de verschillende varianten van analytics. Een nieuw type consumptie dat is ontstaan dankzij de trend om near real-time data hubs te bouwen, is de data beschikbaar maken via API's voor andere applicaties in de organisatie.

Metadata

Metadatatools worden vaak ingezet ter ondersteuning van data governance-programma's. Een goed beheerde business glossary helpt om af te stemmen op business terms en definities, en maakt het mogelijk om de business terms te koppelen aan de data assets die in de data catalog gedocumenteerd zijn. Ze laat ook toe om de data quality op te volgen. Data lineage documenteert en visualiseert waar de data vandaan komt en welke transformaties erop zijn uitgevoerd. Impactanalyse laat toe om de impact op downstream-systemen en rapporteringsomgevingen in te schatten wanneer bronsystemen wijzigen.

Data Lab

Het data lab is een aangewezen omgeving waarin een heterogene set databronnen veilig en kostenefficiënt kan worden verkend om te experimenteren, nieuwe use cases te vinden of ad-hoc rapporten te genereren. Doorgaans wordt de data slechts een beperkte tijd opgeslagen. Als het experiment waarde blijkt te bieden en als het op terugkerende basis waarde zou opleveren, wordt het doorgaans opgenomen in het geïndustrialiseerde dataplatform.

Integratiecomponent

Integratiecomponenten bedden de data-architectuur in en integreren ze binnen het bestaande IT-landschap. Veelvoorkomende voorbeelden zijn een webportaal (zoals (Azure) SharePoint) om informatie en rapporten binnen de organisatie te delen, een authenticatie- en autorisatieprovider (zoals (Azure) Active Directory) of een Graphical Information System waarmee informatie op een geografische kaart kan worden gevisualiseerd. Een ander voorbeeld is dat de laatste actie van een dataflow bestaat uit het aanroepen van de API van een andere applicatie of het posten van een topic om andere applicaties over nieuwe informatie te informeren.

OVER DE AUTEURS

Picture of Kristof Van de Loock

Kristof Van de Loock

Managing Partner

Over Sparkle

Over Sparkle

Sparkle is een strategisch dataconsultancybedrijf, opgericht in 2017 en vandaag thuisbasis van 50+ consultants in België en Estland, dat zijn klanten helpt om hun data ten volle te benutten.

Meer over ons
Kom bij het team

Kom bij ons

Op zoek naar een carrière in data? Ontdek onze openstaande vacatures.

Werken bij Sparkle
Scroll naar boven