Governed AI Training Datasets Directory
How do training datasets comply with EU AI Act Article 10 data quality mandates?
Under Article 10, training, validation, and testing datasets must be subject to appropriate data governance practices, including examination for biases, PII scrubbing verification, copyright opt-out compliance under the DSM Directive, and data provenance auditing.
FineWeb (Hugging Face)
COMPLIANTFineWeb implements automated deduplication, heuristic quality scoring, PII redaction filters, and toxic content removal, satisfying Article 10 requirements for training data curation.
View Article 10 Data Provenance Dossier →Common Crawl Corpus
GAP_IDENTIFIEDDeployers must apply post-ingestion copyright opt-out filtering under Article 53, synthetic PII scrubbing, and statistical bias mitigation before using raw Common Crawl partitions.
View Article 10 Data Provenance Dossier →The Pile (EleutherAI)
GAP_IDENTIFIEDThe Pile contains copyrighted academic and bibliographic sub-corpora requiring proof of text-and-data mining (TDM) opt-out compliance under the EU DSM Directive.
View Article 10 Data Provenance Dossier →RedPajama 1T / v2
COMPLIANTRedPajama provides full per-token quality annotations, deduplication lineage, and explicit source domain categorizations aligned with Article 10 technical documentation.
View Article 10 Data Provenance Dossier →Colossal Clean Crawled Corpus (C4)
COMPLIANTC4 applies aggressive English-language heuristic filters and basic PII scrubbing, though deployers in the EU must verify GDPR compliance for persistent entity references.
View Article 10 Data Provenance Dossier →LAION-5B Multimodal
HIGH_RISK_FLAGGEDLAION-5B contains unfiltered web image-text pairs requiring comprehensive biometric privacy scrubbing and copyright verification under Article 10 and GDPR Article 9.
View Article 10 Data Provenance Dossier →GSM8K Mathematical Reasoning
COMPLIANTGSM8K consists exclusively of grade-school math problem formulations synthesized without personal identity references, ensuring zero PII and full Article 10 compliance.
View Article 10 Data Provenance Dossier →HumanEval Python Benchmark
COMPLIANTHumanEval uses hand-written Python docstrings and unit tests with complete copyright clearance, fulfilling Article 10 data provenance benchmarks for coding models.
View Article 10 Data Provenance Dossier →MMLU Benchmark Suite
COMPLIANTMMLU tests cross-disciplinary knowledge across 57 subjects, providing standardized accuracy benchmarks mandated for systemic risk model filings with the EU AI Office.
View Article 10 Data Provenance Dossier →SQuAD 2.0 Reading Comprehension
COMPLIANTSQuAD 2.0 is licensed under CC BY-SA 4.0, requiring downstream share-alike compliance or commercial clean-room adaptations satisfying Article 53 documentation.
View Article 10 Data Provenance Dossier →MIMIC-III Clinical Database
COMPLIANTUnder Article 10(5) and GDPR Article 9, clinical datasets must maintain strict de-identification, institutional review board (IRB) approvals, and encrypted audit trails.
View Article 10 Data Provenance Dossier →ImageNet (ILSVRC)
GAP_IDENTIFIEDDeployers must document known representation gaps under Article 10(2)(f) and apply balancing transformations before deploying vision systems in Annex III high-risk domains.
View Article 10 Data Provenance Dossier →BookCorpus (Books1/2)
HIGH_RISK_FLAGGEDBookCorpus contains full-text fiction books scraped without author consent, presenting extreme copyright infringement liability and non-compliance with EU TDM opt-out rules.
View Article 10 Data Provenance Dossier →StarCoder Curated Code Corpus
COMPLIANTBigCode provides an automated GitHub repository opt-out portal and strict permissive license filtering, serving as a model implementation for EU AI Act Article 53 compliance.
View Article 10 Data Provenance Dossier →DeepMind CodeContests
COMPLIANTCodeContests provides automated unit test suites and complexity boundaries, ensuring high data integrity and reproducible evaluation metrics under Article 10.
View Article 10 Data Provenance Dossier →OpenAssistant Conversations
COMPLIANTEvery contributor signs an explicit open-source agreement with GDPR consent waivers, fulfilling Article 10 data collection provenance requirements.
View Article 10 Data Provenance Dossier →Stanford Alpaca Instruction Dataset
COMPLIANTSynthetic datasets derived from proprietary LLMs carry contractual non-compete terms and require transparency labeling under EU AI Act Article 50.
View Article 10 Data Provenance Dossier →ShareGPT Conversations Corpus
GAP_IDENTIFIEDTranscripts often contain accidental personal secrets and PII requiring automated entity redaction before being permissible for Article 10 compliant training.
View Article 10 Data Provenance Dossier →WizardLM Evol-Instruct Corpus
COMPLIANTEvol-Instruct algorithmically broadens instruction diversity across complexity dimensions, mitigating dataset homogeneity under Article 10 requirements.
View Article 10 Data Provenance Dossier →Cosmopedia Synthetic Textbook Corpus
COMPLIANTBeing entirely synthetically generated from web seed outlines, Cosmopedia has zero PII, zero copyright infringement liability, and verified data provenance.
View Article 10 Data Provenance Dossier →