Trainings-, validatie- en testdata zijn relevant en voldoende representatief, en het databeheer eromheen past bij het beoogde doel van het systeem.
AI-systemen met een hoog risico die technieken gebruiken die het trainen van AI-modellen met data omvatten, worden ontwikkeld op basis van datasets voor training, validatie en tests die voldoen aan de in de leden 2, 3 en 4 van dit artikel en de in artikel 4 bis, lid 1, bedoelde kwaliteitscriteria, telkens wanneer dergelijke datasets worden gebruikt.
Datasets voor training, validatie en tests worden onderworpen aan praktijken op het gebied van databeheer die stroken met het beoogde doel van het AI-systeem met een hoog risico. Deze praktijken hebben in het bijzonder betrekking op:
Datasets voor training, validatie en tests zijn relevant, voldoende representatief, en zoveel mogelijk foutenvrij en volledig met het oog op het beoogde doel. De datasets hebben bovendien de passende statistische kenmerken, onder meer, waar van toepassing, met betrekking tot de personen of groepen personen ten aanzien van wie de AI-systemen met een hoog risico moeten worden gebruikt. Deze kenmerken van de datasets kunnen op het niveau van de afzonderlijke datasets of combinatie daarvan worden verwezenlijkt.
Ten aanzien van datasets wordt, voor zover vereist gezien het beoogde doel hiervan, rekening gehouden met de eigenschappen of elementen die specifiek zijn voor een bepaalde geografische, contextuele, functionele of gedragsomgeving waarin het AI-systeem met een hoog risico moet worden gebruikt.
Voor de ontwikkeling van AI-systemen met een hoog risico die geen technieken voor de training van AI-modellen gebruiken, zijn de leden 2, 3 en 4 van dit artikel en artikel 4 bis, lid 1, uitsluitend van toepassing op de datasets voor tests.
Dit is hoe het platform dit artikel vertaalt naar werk in uw register.
Zorg voor adequate data governance-praktijken voor trainings-, validatie- en testdatasets. Test representativiteit en bias.