Data Architect
SolliciterenBen je klaar om de data-backbone van de Nederlandse AI-fabriek te ontwerpen en op te bouwen, waar grootschalige data, AI en hoogwaardige infrastructuur samenkomen? Bij SURF speel je een sleutelrol bij het vormgeven van de data-architectuur die baanbrekend onderzoek en innovatie in heel Nederland mogelijk maakt. Als Data Architect zorg je ervoor dat complexe datasets uit meerdere bronnen, evenals de modellen en artefacten, betrouwbaar worden opgeslagen en toegankelijk worden gemaakt. Klinkt het opzetten van de data-infrastructuur achter de Europese AI-ambities als een uitdaging die bij je past? Solliciteer dan nu!
Hier ga je werken
SURF is de ict-coöperatie van Nederlandse onderwijs- en onderzoeksinstellingen. Samen met hen werken we aan digitale diensten en complexe innovatievraagstukken om de kwaliteit van onderwijs en onderzoek te verhogen.
Werken bij SURF betekent deel uitmaken van een unieke en open organisatie. Dat merk je aan alles: de organisatiestructuur, de samenstelling van de projectteams, de cultuur op onze kantoren en de sfeer onder collega’s. SURF biedt uitstekende arbeidsvoorwaarden en hanteert een flexibele benadering van de balans tussen werk en privé. Medewerkers werken graag zelfstandig en iedereen krijgt de ruimte en vrijheid om zijn of haar talenten zo effectief en breed mogelijk in te zetten en te ontwikkelen.
In dit team kom je terecht
Je komt terecht in het High Performance Machine Learning-team van SURF, dat deel uitmaakt van de afdeling Advanced Solutions for Research. Je collega’s werken aan projecten zoals OpenEuroLLM en GPT-NL en ondersteunen onderzoekers bij het optimaal benutten van de Nederlandse nationale supercomputer Snellius voor AI-workloads. Het team kenmerkt zich door een open en samenwerkingsgerichte cultuur, met een sterke focus op het delen van kennis en het ondersteunen van elkaar.
SURF is een van de consortiumpartners achter de Nederlandse AI-fabriek, samen met TNO, AIC4NL en Samenwerking Noord. Binnen dit samenwerkingsverband is SURF verantwoordelijk voor de technische infrastructuur en draagt het zijn expertise op het gebied van supercomputing bij, waardoor veilige toegang wordt geboden tot de rekenkracht en gegevens die nodig zijn voor het ontwikkelen en trainen van AI-modellen. Als onderdeel van SURF werk je daarom rechtstreeks aan de ontwikkeling en levering van de Nederlandse AI-fabriek.
Je werkt nauw samen met AI-consultants, platformingenieurs en andere experts van de consortiumpartners. Samen lever je AI-diensten aan onderzoeksinstellingen, overheidsorganisaties en partners uit de particuliere sector in Nederland en Europa. De Nederlandse AI-fabriek maakt ook deel uit van een breder Europees netwerk van AI-fabrieken en draagt zo bij aan de Europese ambitie om de AI-capaciteiten en technologische soevereiniteit van Europa te versterken.
Collega’s van de verschillende consortiumpartners die aan de AI-fabriek werken, zullen voornamelijk gezamenlijk in Groningen gevestigd zijn, terwijl ze nauwe banden onderhouden met hun respectievelijke organisaties.
Dit ga je doen
Als Data Architect ben je verantwoordelijk voor het ontwerp en de opbouw van de data-backbone en het dataportfolio van de Nederlandse AI-fabriek. De dataservices binnen het dataportfolio zorgen ervoor dat de data (trainingsdata, modellen en artefacten) en het beheer daarvan de pijplijnen van de gebruikers op een veilige, performante en schaalbare manier kunnen ondersteunen, ondersteund door solide governance, compliance en gebruiksvriendelijkheid.
Je verantwoordelijkheden omvatten:
- Technische ontwikkeling van de dataportfolio op de infrastructuur van de AI-fabriek (datalandingszones, gegevensoverdracht tussen verschillende opslagbackends, ondersteuning van pijplijnen voor het gedistribueerd laden van gegevens voor training met meerdere GPU’s/meerdere knooppunten, enz.);
- Activiteiten voor het ontwerpen van het datagovernance- en toegangscontrolemodel en de technische implementatie daarvan;
- Het testen en implementeren van technische diensten voor het beheer van trainingsgegevens en modeluitkomsten (herkomst, versiebeheer, metagegevens, enz.);
- Strikte beveiliging en naleving van regelgeving voor gevoelige gegevens (bijv. via de implementatie van beveiligde enclaves);
- Ontwerp en ondersteuning bij het opzetten van schaalbare datapijplijnen voor grootschalige AI-workloads; ondersteuning van de integratie met Europese gegevensruimten en nationale sectorale gegevensinfrastructuren;
- Bijdragen aan de datadienstencatalogus en de gebruikersdocumentatie;
- Advies verlenen aan projectteams over hun end-to-end AI-workflows.
Dit breng je mee
Je bent een ervaren data-architect met meer dan 5 jaar technische praktijkervaring, waarbij de nadruk ligt op schaalbare, toekomstbestendige dataoplossingen. Dankzij je leiderschapskwaliteiten en uitgebreide praktijkervaring breng je structuur in complexe situaties; je kunt belanghebbenden op verschillende niveaus binnen organisaties aansturen en AI-consultants en platformingenieurs begeleiden bij het opbouwen van de data-backbone.
Daarnaast beschik je over:
- Een BSc/MSc-diploma in informatica (inclusief AI), datawetenschap, informatiewetenschap of een gelijkwaardige opleiding
- Sterke praktische ervaring met AI-workflows en engineeringtools
- Een grondig begrip van de beveiliging van host- en bestandssystemen, en van authenticatie- en autorisatieprincipes in GNU/Linux-omgevingen
- Kennis van databases (relationeel, niet-relationeel), objectopslag (S3-compatibel), gedeelde parallelle bestandssystemen (POSIX) en datacatalogi
- Praktische ervaring met tools voor de volledige levenscyclus van ML/AI-workflows (bijv. MLFlow, wandb, enz.) en met tools voor gegevensversiebeheer en -herkomst (bijv. DVC, LakeFS, Delta/Iceberg)
- Ervaring met datagovernance en/of privacyregelgeving (bijv. AVG, AI-wet)
- Goede beheersing van Python; ervaring met gecontaineriseerde datapijplijnen
- Uitstekende beheersing van het Engels; Nederlands is een pluspunt
Sterke pluspunten
- Ervaring met het beheer van grote AI-datasets, inclusief versiebeheer, reproduceerbaarheid en geautomatiseerde monitoring van datakwaliteit
- Kennis van NLP-datapijplijnen (taaldetectie, PII-detectie, tekstnormalisatie)
- Ervaring met gedistribueerde gegevensverwerking op rekeninfrastructuur (HPC-systemen, Kubernetes)
- Ervaring met ETL/ELT-pijplijnen, data lakes en datawarehousing
- Bekendheid met tools voor workflow-orkestratie (bijv. Airflow)
- Kennis van linked data, RDF of SPARQL
- Kennis van FAIR-principes en ervaring met metadatastandaarden
Aanvullende informatie
Een antecedentenonderzoek kan deel uitmaken van het wervingsproces. Let er daarnaast op dat sollicitatiegesprekken op het SURF kantoor in Amsterdam plaats zullen vinden.
Bij SURF doen we onze werving met veel plezier zelf, acquisitie stellen we daarom niet op prijs.