Data Marketplace

Flitto Data Marketplace offers license-verified AI training and evaluation datasets in text, speech, image, and video across 100+ languages and 23+ domains. Try a free sample, then contact us to purchase.

Sell your data on Flitto

Simply register your data and check its sale eligibility.

A total of 326 datasets
  • Pre-training DataAudio

    English Speech Dataset by Korean Speakers

    A single-turn English speech dataset recorded by Korean speakers.

    DomainHumanities and Social|Lifestyle
    LanguageEnglish
  • Pre-training DataAudio

    Indonesian Speech Dataset by Korean Speakers

    A single-turn Indonesian speech dataset recorded by Korean speakers.

    DomainHumanities and Social|Lifestyle
    LanguageIndonesian
  • Pre-training DataAudio

    Vietnamese Speech Dataset by Korean Speakers

    A single-turn Vietnamese speech dataset recorded by Korean speakers.

    DomainHumanities and Social|Lifestyle
    LanguageVietnamese
  • Pre-training DataAudio

    English Finance Domain Speech Dataset

    A single-turn English speech dataset specialized for the finance domain.

    DomainManagement, Economic and Finance
    LanguageEnglish
  • Pre-training DataAudio

    English Single-Utterance Speech Dataset for ICT & Software Domains

    A single-turn English speech dataset featuring monologues by IT and software professionals about their work experiences.

    DomainIT and Tech
    LanguageEnglish
  • Pre-training DataAudio

    English Single-Utterance Speech Dataset for Finance & Economics Domains

    A single-turn English speech dataset featuring monologues about workplace experiences in finance.

    DomainManagement, Economic and Finance
    LanguageEnglish
  • Fine-tuning DataText

    Python, JavaScript, and Java Code Generation and Refactoring Dataset

    A code generation and refactoring dataset built from source code snippets, with software and IT specialists creating improvement instructions and revised code outputs.

    DomainIT and Tech
    LanguageKorean
  • Fine-tuning DataText

    Korean Code Instruction and Commenting Text Dataset

    A Korean code completion dataset built from source code snippets, Korean declarative and imperative instructions, and block-level and line-level comments written by software and IT specialists.

    DomainIT and Tech
    LanguageKorean
  • Alignment DataText

    English Safety Multi-Turn Chat Text Dataset

    An English safety multi-turn chat text dataset built by professional annotators for safety alignment training based on defined safety criteria.

    DomainHumanities and Social
    LanguageEnglish
  • Pre-training DataText

    Arabic General-Domain Multi-Turn Chat Text Dataset

    An Arabic general-domain multi-turn chat text dataset built by professional native-language annotators for daily life and general conversation domains.

    DomainHumanities and Social
    LanguageArabic