📦 AI Assets & Catalogs:
Namespace Satellite: datasets.aiacts.app

Governed AI Training Datasets Directory

How do training datasets comply with EU AI Act Article 10 data quality mandates?

Under Article 10, training, validation, and testing datasets must be subject to appropriate data governance practices, including examination for biases, PII scrubbing verification, copyright opt-out compliance under the DSM Directive, and data provenance auditing.

FineWeb (Hugging Face)

COMPLIANT
License: ODC-By 1.0 | PII: verified_scrubbed | Copyright: Public Web / Filtered

FineWeb implements automated deduplication, heuristic quality scoring, PII redaction filters, and toxic content removal, satisfying Article 10 requirements for training data curation.

View Article 10 Data Provenance Dossier →

Common Crawl Corpus

GAP_IDENTIFIED
License: Terms of Use | PII: partial | Copyright: Mixed Web Content

Deployers must apply post-ingestion copyright opt-out filtering under Article 53, synthetic PII scrubbing, and statistical bias mitigation before using raw Common Crawl partitions.

View Article 10 Data Provenance Dossier →

The Pile (EleutherAI)

GAP_IDENTIFIED
License: Academic / Open Access | PII: partial | Copyright: Mixed / Academic Fair Use

The Pile contains copyrighted academic and bibliographic sub-corpora requiring proof of text-and-data mining (TDM) opt-out compliance under the EU DSM Directive.

View Article 10 Data Provenance Dossier →

RedPajama 1T / v2

COMPLIANT
License: Apache 2.0 | PII: verified_scrubbed | Copyright: Permissive / Open Weights

RedPajama provides full per-token quality annotations, deduplication lineage, and explicit source domain categorizations aligned with Article 10 technical documentation.

View Article 10 Data Provenance Dossier →

Colossal Clean Crawled Corpus (C4)

COMPLIANT
License: ODC-By | PII: verified_scrubbed | Copyright: Cleaned Web Text

C4 applies aggressive English-language heuristic filters and basic PII scrubbing, though deployers in the EU must verify GDPR compliance for persistent entity references.

View Article 10 Data Provenance Dossier →

LAION-5B Multimodal

HIGH_RISK_FLAGGED
License: CC-BY 4.0 | PII: uncleaned | Copyright: Unfiltered Image URLs

LAION-5B contains unfiltered web image-text pairs requiring comprehensive biometric privacy scrubbing and copyright verification under Article 10 and GDPR Article 9.

View Article 10 Data Provenance Dossier →

GSM8K Mathematical Reasoning

COMPLIANT
License: MIT | PII: synthetic_only | Copyright: Public Domain Math

GSM8K consists exclusively of grade-school math problem formulations synthesized without personal identity references, ensuring zero PII and full Article 10 compliance.

View Article 10 Data Provenance Dossier →

HumanEval Python Benchmark

COMPLIANT
License: MIT | PII: synthetic_only | Copyright: Handcrafted Python

HumanEval uses hand-written Python docstrings and unit tests with complete copyright clearance, fulfilling Article 10 data provenance benchmarks for coding models.

View Article 10 Data Provenance Dossier →

MMLU Benchmark Suite

COMPLIANT
License: MIT | PII: verified_scrubbed | Copyright: Curated Exam Questions

MMLU tests cross-disciplinary knowledge across 57 subjects, providing standardized accuracy benchmarks mandated for systemic risk model filings with the EU AI Office.

View Article 10 Data Provenance Dossier →

SQuAD 2.0 Reading Comprehension

COMPLIANT
License: CC BY-SA 4.0 | PII: verified_scrubbed | Copyright: Wikipedia Derived

SQuAD 2.0 is licensed under CC BY-SA 4.0, requiring downstream share-alike compliance or commercial clean-room adaptations satisfying Article 53 documentation.

View Article 10 Data Provenance Dossier →

MIMIC-III Clinical Database

COMPLIANT
License: PhysioNet Credentialed | PII: verified_scrubbed | Copyright: HIPAA De-Identified EHR

Under Article 10(5) and GDPR Article 9, clinical datasets must maintain strict de-identification, institutional review board (IRB) approvals, and encrypted audit trails.

View Article 10 Data Provenance Dossier →

ImageNet (ILSVRC)

GAP_IDENTIFIED
License: Non-Commercial Research | PII: partial | Copyright: Fair Use Research

Deployers must document known representation gaps under Article 10(2)(f) and apply balancing transformations before deploying vision systems in Annex III high-risk domains.

View Article 10 Data Provenance Dossier →

BookCorpus (Books1/2)

HIGH_RISK_FLAGGED
License: Unpublished Books | PII: uncleaned | Copyright: High Copyright Liability

BookCorpus contains full-text fiction books scraped without author consent, presenting extreme copyright infringement liability and non-compliance with EU TDM opt-out rules.

View Article 10 Data Provenance Dossier →

StarCoder Curated Code Corpus

COMPLIANT
License: BigCode OpenRAIL-M | PII: verified_scrubbed | Copyright: Permissive Open Source

BigCode provides an automated GitHub repository opt-out portal and strict permissive license filtering, serving as a model implementation for EU AI Act Article 53 compliance.

View Article 10 Data Provenance Dossier →

DeepMind CodeContests

COMPLIANT
License: Apache 2.0 | PII: synthetic_only | Copyright: Competitive Programming

CodeContests provides automated unit test suites and complexity boundaries, ensuring high data integrity and reproducible evaluation metrics under Article 10.

View Article 10 Data Provenance Dossier →

OpenAssistant Conversations

COMPLIANT
License: Apache 2.0 | PII: verified_scrubbed | Copyright: Volunteer Crowdsourced

Every contributor signs an explicit open-source agreement with GDPR consent waivers, fulfilling Article 10 data collection provenance requirements.

View Article 10 Data Provenance Dossier →

Stanford Alpaca Instruction Dataset

COMPLIANT
License: CC BY-NC 4.0 | PII: synthetic_only | Copyright: Synthetic (text-davinci-003)

Synthetic datasets derived from proprietary LLMs carry contractual non-compete terms and require transparency labeling under EU AI Act Article 50.

View Article 10 Data Provenance Dossier →

ShareGPT Conversations Corpus

GAP_IDENTIFIED
License: User Shared Logs | PII: partial | Copyright: User Interaction Scrapes

Transcripts often contain accidental personal secrets and PII requiring automated entity redaction before being permissible for Article 10 compliant training.

View Article 10 Data Provenance Dossier →

WizardLM Evol-Instruct Corpus

COMPLIANT
License: Research Only | PII: synthetic_only | Copyright: Complex Synthetic Instructions

Evol-Instruct algorithmically broadens instruction diversity across complexity dimensions, mitigating dataset homogeneity under Article 10 requirements.

View Article 10 Data Provenance Dossier →

Cosmopedia Synthetic Textbook Corpus

COMPLIANT
License: CC-BY 4.0 | PII: synthetic_only | Copyright: 100% Synthetic Generated

Being entirely synthetically generated from web seed outlines, Cosmopedia has zero PII, zero copyright infringement liability, and verified data provenance.

View Article 10 Data Provenance Dossier →
No matching training datasets found. Try another search term.