Data Marketplace

Flitto Data Marketplace offers license-verified AI training and evaluation datasets in text, speech, image, and video across 100+ languages and 23+ domains. Try a free sample, then contact us to purchase.

Sell your data on Flitto

Simply register your data and check its sale eligibility.

A total of 326 datasets
  • Pre-training DataAudio

    Egyptian Arabic Energy Domain Speech Dataset

    A single-turn energy domain speech dataset based on the Egyptian Arabic dialect.

    DomainBio, Environment and Energy
    LanguageArabic (Egypt)
  • Pre-training DataAudio

    Standard Arabic Public Administration Domain Speech Dataset

    A single-turn public administration domain speech dataset based on Modern Standard Arabic (MSA).

    DomainLaw and Public
    LanguageArabic
  • Pre-training DataAudio

    Gulf Arabic Public Administration Domain Speech Dataset

    A single-turn public administration domain speech dataset based on the Gulf Arabic dialect.

    DomainLaw and Public
    LanguageArabic (Saudi Arabia)|Arabic|Arabic (Kuwait)|Arabic (Qatar)|Arabic (Bahrain)|Arabic (Oman)|Arabic (Yemen)
  • Pre-training DataAudio

    North African Arabic Public Administration Domain Speech Dataset

    A single-turn public administration domain speech dataset based on the North African Arabic (Maghrebi Arabic) dialect.

    DomainLaw and Public
    LanguageArabic (Morocco)|Arabic (Algeria)|Arabic (Tunisia)|Arabic (Libya)|Arabic (Mauritania)
  • Pre-training DataAudio

    Egyptian Arabic Public Administration Domain Speech Dataset

    A single-turn public administration domain speech dataset based on the Egyptian Arabic dialect.

    DomainLaw and Public
    LanguageArabic (Egypt)
  • Alignment DataImage

    Arabic Construction Image Captioning and Preference QA Dataset

    A multimodal Arabic image dataset combining image captions and preference QA for general and construction domains, reviewed and annotated by construction and engineering domain experts.

    DomainScience and Engineering|Humanities and Social
    LanguageArabic
  • Pre-training DataText

    Multilingual Multi-Turn Chat Text Dataset

    A multilingual multi-turn chat text dataset built directly by professional annotators, including speaker information, proper nouns, chat slang, typo tags, and natural conversational turns.

    DomainHumanities and Social
    LanguageKorean|Hindi|Indonesian|Arabic|Thai|Bengali|Arabic (Egypt)|Japanese
  • Pre-training DataText

    Multilingual Domain-Specific Parallel Translation Corpus Text Dataset

    A multilingual domain-specific parallel translation corpus dataset built from Korean-to-English, Korean-to-Arabic, and Korean-to-Chinese translations specialized in military, finance, and legal domains, curated by expert annotators.

    DomainLaw and Public
    LanguageKorean|Bengali|Hindi|Indonesian|Japanese|Thai|Arabic (United Arab Emirates)|Arabic (Egypt)
  • Evaluation DataText

    General Arena Benchmark Dataset

    A Korean-based Arena benchmark text dataset built for evaluating AI model performance in general-domain comparison tasks.

    DomainIT and Tech|Humanities and Social|Science and Engineering
    LanguageKorean
  • Evaluation DataText

    General BFCL 3v Benchmark Dataset

    A Korean-based BFCL 3v benchmark text dataset built for evaluating function-calling capabilities of AI models.

    DomainIT and Tech|Humanities and Social|Science and Engineering
    LanguageKorean