Choose a dataset release
Use synthetic, multilingual records for training and evaluation without introducing real personal data. Compare releases by scale, coverage, license and best fit.
- Scale
- 3M+ rows
- Coverage
- 30 languages · 3 regions
- License
- CC-BY-4.0 + Enterprise
- Best fit
- Asia-Pacific training and evaluation
- Scale
- 2M+ rows
- Coverage
- 32 locales · 98 entities
- License
- CC-BY-4.0 + Enterprise
- Best fit
- European training and evaluation
- Scale
- 1M series
- Coverage
- 11 regions
- License
- CC-BY-4.0 open core
- Best fit
- Open-core model training
- Scale
- 400K+ largest release
- Coverage
- 6 languages · 17–54 entities across the series
- License
- Ai4Privacy Dataset and Derivative Products License
- Best fit
- Comparing smaller release sizes